Input Multimodal
Gambar, audio, video, PDF — 69 model multimodal.
The content array pattern
from openai import OpenAI client = OpenAI(base_url="https://meshtok.com/v1", api_key="sk-...") resp = client.chat.completions.create( model="google/gemini-2.5-pro", messages=[{ "role": "user", "content": [ {"type": "text", "text": "Here are three files. Summarize each."}, {"type": "image_url", "image_url": {"url": "https://.../chart.png"}}, {"type": "input_audio", "input_audio": {"data": "<base64>", "format": "mp3"}}, ], }], )
Audio input
import base64 with open("meeting.mp3", "rb") as f: audio_b64 = base64.b64encode(f.read()).decode() resp = client.chat.completions.create( model="google/gemini-2.5-pro", messages=[{ "role": "user", "content": [ {"type": "text", "text": "Transcribe and extract action items."}, {"type": "input_audio", "input_audio": {"data": audio_b64, "format": "mp3"}}, ], }], )
Cost notes
- Images: ~765 tokens per 1024×1024 tile.
- Audio: ~30-50 tokens per second depending on model.
- Video: billed by frame count × image token rate.