多模態輸入

圖片、音訊、影片、PDF — 支援 69 個多模態模型。

The content array pattern

from openai import OpenAI
client = OpenAI(base_url="https://meshtok.com/v1", api_key="sk-...")

resp = client.chat.completions.create(
    model="google/gemini-2.5-pro",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Here are three files. Summarize each."},
            {"type": "image_url", "image_url": {"url": "https://.../chart.png"}},
            {"type": "input_audio", "input_audio": {"data": "<base64>", "format": "mp3"}},
        ],
    }],
)

Audio input

import base64

with open("meeting.mp3", "rb") as f:
    audio_b64 = base64.b64encode(f.read()).decode()

resp = client.chat.completions.create(
    model="google/gemini-2.5-pro",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Transcribe and extract action items."},
            {"type": "input_audio", "input_audio": {"data": audio_b64, "format": "mp3"}},
        ],
    }],
)

Cost notes

→ 視覺與圖片輸入 → 結構化輸出 多模態輸入