MeshTok 目錄裡收錄了十多款上下文視窗在百萬 token 以上的模型。它們幾乎都為了達到這個量級而有所妥協——沒有視覺、沒有影片、沒有音訊、最大輸出受限,或者缺少 flagship 標籤。Gemini 3.1 Pro 是個例外:1,048,576 token 的上下文視窗、65,536 token 的最大輸出、原生圖像+影片+音訊輸入,外加 reasoning、tools、json 與 flagship 標籤,全部集中在一個模型 ID 裡。本文要回答的問題是:這套組合是否配得上每百萬 token $2 / $12 的定價。
這是一篇規格與定價分析,不是合成 benchmark。我們沒有跑延遲測試,沒有測各上下文位置上的「大海撈針」召回率,也不會發布任何無法用線上目錄資料背書的數字。下文每一個數字都是你用計算機從 src/data/models.ts 就能重現的算術。目標是幫你判斷 Gemini 3.1 Pro 的百萬 token 視窗是否值得在你路由層裡佔一席之地——判斷依據是對預算真正關鍵的資料:上下文視窗、最大輸出、多模態覆蓋、每百萬 token 價格。
進入數字之前先說一句實話:目錄裡的模型 ID 是 google/gemini-3.1-pro-preview。這個 -preview 後綴來自來源資料,我們不會把它藏起來。規格表可以視為準確,但在鎖定正式路由決策之前,請對照 https://meshtok.com/v1/models 再核對一次。
Gemini 3.1 Pro:規格表
現在透過 MeshTok 統一 API(https://meshtok.com/v1),使用模型 ID google/gemini-3.1-pro-preview 即可呼叫。
| 欄位 | 取值 |
|---|---|
| 供應商 | Google(美國) |
| 上下文視窗 | 1,048,576 token(2²⁰,略高於 1M) |
| 最大輸出 | 65,536 token |
| 輸入價格(每百萬 token) | $2.00 |
| 輸出價格(每百萬 token) | $12.00 |
| 能力標籤 | image, video, audio, reasoning, tools, json, flagship |
| 發布時間 | 2026-06 |
| 知識截止 | 2026-05 |
這一級別上有三點特別突出:
- 目錄中多模態模型裡最大的「上下文+輸出」合計視窗。 1,048,576 輸入 + 65,536 輸出意味著一次呼叫可以吞下大約百萬 token 的混合文字、圖像、音訊、影片,並吐出 65K token 的回應。
models.ts裡再沒有其他模型能同時滿足這三項:1M+ 上下文、65K+ 最大輸出、以及 image+video+audio 輸入。 - 完整原生多模態,含影片與音訊。 多數 1M 上下文競品止步於
image(DeepSeek V4 Pro、Qwen3.7 Max、Doubao Seed 2.1 Pro),甚至直接砍掉視覺(GLM-5.2)。Gemini 3.1 Pro 是目錄裡唯一在 1M 上下文旗艦級原生接收影片與音訊的模型,與文字和圖像並列。 - 帶
flagship與reasoning標籤。 Google 給它貼的是為前沿級保留的能力標籤。更便宜的 Gemini Flash 變體貼的是fast而不是reasoning和flagship——這就是家族內部的結構性分界。
百萬 token 之問:1M 上下文到底要花多少錢?
這是多數行銷頁會跳過的部分。百萬 token 的上下文視窗是一筆預算,不是免費午餐。你放進去的每個 token 都按輸入費率計費。比較長上下文模型的正確做法是算「實際把視窗用滿」的成本。
一次滿載呼叫的成本(1M 輸入 + 簡短摘要)
典型的長上下文負載:送進約 1M token 的文件,要一份簡短摘要或幾條行動項。我們假設輸入 1,048,576 token、輸出 1,000 token。
| 模型 | 輸入成本 | 輸出成本 | 單次呼叫合計 |
|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | $0.012 | $2.109 |
| Gemini 2.5 Pro | $1.311 | $0.010 | $1.321 |
| Gemini 3 Flash | $0.524 | $0.003 | $0.527 |
| DeepSeek V4 Pro | $0.449 | $0.001 | $0.450 |
| GLM-5.2 | $1.143 | $0.004 | $1.147 |
| Claude Sonnet 5 | $3.000 | $0.015 | $3.015 |
一次滿載的 Gemini 3.1 Pro 呼叫大約 $2.11。一天跑一千次,光輸入 token 就是 $2,109/天——大約 $63K/月。這不是叫你避開這個模型的理由,而是提醒你什麼時候才真正需要把視窗用滿要審慎。
滿載長輸出呼叫的成本(1M 輸入 + 用滿最大輸出)
Gemini 3.1 Pro 的定價結構真正區別於其他模型的場景,是連最大輸出也一起用滿的情況。這裡假設上下文塞到上限,並允許模型輸出它的完整最大輸出。
| 模型 | 1M 輸入 | 用滿的最大輸出 | 輸出成本 | 單次呼叫合計 |
|---|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | 65,536 | $0.786 | $2.883 |
| GLM-5.2 | $1.143 | 128,000 | $0.512 | $1.655 |
| DeepSeek V4 Pro | $0.449 | 32,768 | $0.028 | $0.477 |
| Claude Sonnet 5 | $3.000 | 16,384 | $0.246 | $3.246 |
GLM-5.2 單次滿載呼叫更便宜,是因為它的最大輸出有 128K,但定價是 $4/1M 而不是 $12/1M。Gemini 3.1 Pro 與 GLM-5.2 之間的決定因素不是價格——而是你是否需要影片與音訊輸入,GLM-5.2 完全不接受這兩類輸入。
一百萬次短對話呼叫的成本(每次 1K 輸入 + 500 輸出)
在另一個極端做個 sanity check:一百萬次短呼叫,每次消耗 1,000 輸入 token、產出 500 輸出 token。彙總下來是 10 億輸入 token、5 億輸出 token。
| 模型 | 輸入成本(10 億 in) | 輸出成本(5 億 out) | 100 萬次呼叫合計 |
|---|---|---|---|
| Gemini 3.1 Pro | $2,000 | $6,000 | $8,000 |
| Gemini 2.5 Pro | $1,250 | $5,000 | $6,250 |
| Gemini 3 Flash | $500 | $1,500 | $2,000 |
| DeepSeek V4 Pro | $429 | $429 | $857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
| Claude Sonnet 5 | $3,000 | $7,500 | $10,500 |
在短對話流量上,Gemini 3.1 Pro 大約比 DeepSeek V4 Pro 貴 9.3 倍、比 GLM-5.2 貴 2.5 倍。教訓很直白:百萬 token 視窗是高階特性,不應該為根本用不到它的流量付費。
Gemini 家族內部:選哪個?
MeshTok 目錄裡有 7 款上下文視窗達到 1M 級別的 Gemini 模型。選哪個,本質上是推理深度、多模態覆蓋、價格之間的取捨。
| 模型 | 上下文 | 最大輸出 | 輸入 $/M | 輸出 $/M | 影片 | 音訊 | 推理 | 旗艦 |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 2.5 Pro | 1,048,576 | — | $1.25 | $10.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 3.5 Flash | 1,048,576 | 65,536 | $1.50 | $9.00 | ✅ | ✅ | — | — |
| Gemini 3 Flash | 1,048,576 | 65,536 | $0.50 | $3.00 | ✅ | ✅ | — | — |
| Gemini 3.1 Flash Lite | 1,048,576 | — | $0.25 | $1.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash | 1,048,576 | — | $0.30 | $2.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash Lite | 1,000,000 | — | $0.10 | $0.40 | ✅ | ✅ | — | — |
怎麼讀這張表:
- Gemini 3.1 Pro vs Gemini 2.5 Pro——2.5 Pro 是上一代旗艦,兩個軸都更便宜($1.25/$10 對 $2/$12)。多花錢買 3.1 Pro 的理由:明確的 65,536 最大輸出(2.5 Pro 在目錄裡沒有顯式
maxOutput)、更新的知識截止(2026-05)、更新的 3.1 世代。繼續留在 2.5 Pro 的理由:如果你不需要這幾項,它就嚴格更便宜。 - Gemini 3.1 Pro vs Gemini 3 Flash——Flash 是 1/4 的價格,共享同樣的 1M 上下文、65K 最大輸出和完整多模態輸入。你放棄的是
reasoning和flagship。對不需要逐步推理的高吞吐多模態分類、轉寫、路由任務,Flash 是正確的選擇。但凡能從推理鏈受益——多步分析、需要綜合的長文件問答——3.1 Pro 就是升級方向。 - Gemini 3.1 Pro vs Gemini 3.1 Flash Lite / 2.5 Flash Lite——Lite 系是預算級。保留了 1M 上下文和多模態輸入,但去掉了推理和顯式最大輸出上限。當你需要便宜地吃下大量 token、且對回應品質門檻中等時,就用它們。
Gemini 3.1 Pro vs 其他 1M 上下文旗艦
Gemini 3.1 Pro 和其他實驗室更知名的 1M 上下文旗艦相比如何?
| 模型 | 上下文 | 最大輸出 | 輸入 $/M | 輸出 $/M | 影片 | 音訊 | 發布 |
|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | 2026-06 |
| DeepSeek V4 Pro | 1,000,000 | 32,768 | $0.4286 | $0.8571 | — | — | 2026-04 |
| GLM-5.2 | 1,000,000 | 128,000 | $1.1429 | $4.0000 | — | — | 2026-07 |
| Qwen3.7 Max | 1,000,000 | 8,192 | $0.8571 | $2.5714 | — | — | 2026-06 |
| Claude Sonnet 5 | 1,000,000 | 16,384 | $3.0000 | $15.0000 | — | — | 2026-05 |
| Claude Opus 4.8 | 1,000,000 | 32,000 | $5.0000 | $25.0000 | — | — | 2026-06 |
兩點結構性觀察:
- Gemini 3.1 Pro 是這張表裡唯一帶原生影片與音訊輸入的模型。 其他 1M 上下文旗艦最多只能接受圖像。如果你的負載是影片理解、會議轉寫,或任何把影音和文字一起送進去的 pipeline,Gemini 3.1 Pro 不是更便宜的選項——而是 1M 上下文級別裡唯一的選項。
- GLM-5.2 最大輸出最長(128K),但完全沒有多模態。 如果你的負載需要從純文字輸入生成超長的單輪文字回應,GLM-5.2 既更便宜也有更長的輸出視窗。一旦需要圖像、影片或音訊,GLM-5.2 就出局,Gemini 3.1 Pro 重新進入討論。
長上下文 vs RAG 的取捨(坦誠版)
「百萬 token 視窗值不值」這個問題,幾乎總是歸結為成本問題,而不是能力問題。1M 上下文讓你可以跳過檢索 pipeline,把所有東西一股腦塞進 prompt。這很方便,但在 $2/1M 輸入的價位上每次呼叫都很貴——而且下一次呼叫還要再付一次,因為上下文視窗不會免費快取。
完全從上面定價推導出的一條簡單經驗法則:
- 如果同一個大語料會被反覆查詢,檢索更便宜。送 5K 檢索 token 按 $2/1M = 每次呼叫 $0.01,對比 1M token 按 $2/1M = 每次呼叫 $2.00。每跑一次完整上下文呼叫,對應大約 200 次純檢索呼叫才會回本。
- 如果語料只查一兩次就丟掉(新轉寫稿的一次性摘要、合約的精讀一次、對程式庫的臨時探索),長上下文就是正確的工具。檢索系統的搭建成本會比它省下的 token 還高。
- 如果需要在長時間跨度上做音訊或影片理解(2 小時的會議錄音、長影片),Gemini 3.1 Pro 是目錄裡唯一把這種輸入模態和 1M 視窗結合的模型。1M 級別內沒有更便宜的替代——取捨是在 Gemini 3.1 Pro 和「更短上下文模型+分塊」之間。
什麼時候選 Gemini 3.1 Pro(什麼時候不選)
不存在「最好的模型」——只有針對給定負載和預算的合適模型。把這張表作為起點,再用你自己的 eval 驗證。
| 負載 | 推薦 | 原因 |
|---|---|---|
| 長影片或長音訊理解(媒體量 1M+ token) | Gemini 3.1 Pro | 目錄裡唯一帶原生 video 和 audio 輸入的 1M 上下文模型。這一級別沒有更便宜的替代。 |
| 混合多模態長上下文分析(文字+圖像+音訊) | Gemini 3.1 Pro | 唯一把 1M 上下文、65K 最大輸出、完整多模態輸入合一的旗艦。 |
| 超長輸出(>65K,最高 128K)的純文字長上下文 | GLM-5.2 | GLM-5.2 的 128K 最大輸出是獨一份。滿載長輸出呼叫更便宜。無視覺。 |
| 預算有限、高吞吐的 1M 上下文多模態 | Gemini 3 Flash | 3.1 Pro 的 1/4 價格,相同 1M 上下文、相同多模態輸入。去掉了推理。 |
| 盡可能便宜的 1M 上下文(文字或圖像) | DeepSeek V4 Pro | $0.43/1M 輸入——比 Gemini 3.1 Pro 輸入便宜 4.7 倍。無影片/音訊。 |
| 頂級程式碼品質,成本其次 | Claude Sonnet 5 | Anthropic 的定位和社群評測把 Sonnet 5 放在程式碼任務第一級。如果多模態長上下文更重要,則用 Gemini 3.1 Pro。 |
| 不需要多模態的長上下文分析推理 | GLM-5.2 或 DeepSeek V4 Pro | 兩者在純文字長上下文任務上都更便宜。要長輸出選 GLM-5.2,要最低成本選 V4 Pro。 |
一個合理的預設路由策略:把任何含影片或音訊的呼叫路由到 Gemini 3.1 Pro;把超長輸出的純長文字重構路由到 GLM-5.2;把低成本、高吞吐的文字+圖像流量路由到 DeepSeek V4 Pro;把 Claude Sonnet 5 留給高風險程式碼任務。Gemini 3.1 Pro 是多模態長上下文的專家模型,不是一切的預設。
如何呼叫 Gemini 3.1 Pro(真實可執行的程式碼)
MeshTok 在 https://meshtok.com/v1 暴露一個 OpenAI 相容端點。在 Gemini 3.1 Pro 和本文其他模型之間切換,只需改 model 欄位一行——同一套 SDK、同一個 API key、同一種請求格式。下面的範例展示長上下文多模態的寫法:一段長文字 prompt 加一個圖片 URL,作為一次呼叫發出。
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
"""Same call, different model and modality — switch with one string."""
content = [{"type": "text", "text": prompt}]
if image_url:
content.append({"type": "image_url", "image_url": {"url": image_url}})
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": content}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
multimodal_long = ask("google/gemini-3.1-pro-preview",
"Summarize this 800K-token transcript and extract action items.",
image_url="https://example.com/chart.png")
text_only_long = ask("bigmodel/glm-5.2",
"Rewrite this 50K-token file with the new API.")
cheap_long = ask("deepseek/deepseek-v4-pro",
"Summarize this 200K-token document.")
coding_flagship = ask("anthropic/claude-sonnet-5",
"Refactor this Python function and add tests.")
串流、工具呼叫、JSON 模式、圖像輸入的用法都一樣——改 model 字串、加上相關參數即可。串流回應傳 stream=True;工具呼叫傳 tools 參數;結構化輸出用 response_format={"type": "json_object"}。Python、JavaScript、cURL 的完整範例見 MeshTok 串流文件 與 工具呼叫文件。
FAQ
Gemini 3.1 Pro 真的是唯一帶影片和音訊輸入的 1M 上下文模型嗎?
截至 2026-07-21,是的。src/data/models.ts 裡上下文視窗達到 1M+ 的其他所有模型——DeepSeek V4 Pro、DeepSeek V4 Flash、GLM-5.2、Qwen3.7 Max/Plus、Qwen3.5 Plus/Flash、Qwen3.6 Plus、Claude Sonnet 5、Claude Opus 4.6/4.7/4.8、MiniMax M3、Longcat 2.0、Mimo V2 Pro/V2.5——要麼只接受文字,要麼只接受文字加圖像。沒有一款帶 video 或 audio 能力標籤。帶原生影片/音訊輸入的只有 Gemini 家族自己。
為什麼本文沒有延遲或召回 benchmark? 因為我們沒跑,也不會發布無法用原始日誌背書的數字。長上下文召回(「大海撈針」問題)取決於 prompt 形態、位置、語言,以及模型在每個深度上的注意力行為——沒有測試框架、prompt 和原始輸出做支撐,單一一個召回百分比是行銷,不是資料。如果你需要針對自己負載的召回數字,就在 MeshTok 上用你自己的語料自己跑。上面的定價和能力資料才是穩定可驗證的部分。
模型 ID 裡的 -preview 後綴是個問題嗎?
它是個訊號,不是阻塞項。Google 在目錄裡把 3.1 Pro 作為 preview 模型發布(google/gemini-3.1-pro-preview)。這通常意味著規格表是準確的,但模型可能在不改版本號的情況下調整行為。對穩定性要求高於最新能力的正式路由場景,Gemini 2.5 Pro 是價格更低的非 preview 旗艦替代。
Gemini 3.1 Pro 和 Gemini 2.5 Pro 比如何?
2.5 Pro 是 Google 上一代旗艦。它更便宜($1.25/$10 對 $2/$12),帶同樣的 flagship + reasoning + 完整多模態標籤,上下文視窗同樣是 1,048,576。多花錢買 3.1 Pro 的理由:明確的 65,536 最大輸出、更新的知識截止(2026-05)、更新的 3.1 世代。繼續留在 2.5 Pro 的理由:如果你不需要這三項,它就嚴格更便宜。
Gemini 3.1 Pro 支援工具呼叫和結構化輸出嗎?
支援。capabilities 欄位裡列出了 tools 和 json,意味著原生函式呼叫和 JSON 模式結構化輸出都透過 MeshTok 的 OpenAI 相容端點支援。請求格式和 OpenAI 完全一致——只有 model 欄位不同。
1M 上下文視窗是真實的還是行銷?
它是 src/data/models.ts 裡宣告的上下文視窗,從 Google 自己的模型卡同步而來。實際可用上下文取決於你的 prompt 形態、檢索策略,以及模型如何處理長上下文注意力——這些都應該在你自己的資料上測。目錄裡的數字是模型接受的上限,不是每個位置上的品質保證。
為什麼 Gemini 3.1 Pro 比 DeepSeek V4 Pro 貴這麼多? 成本結構和能力都不同。DeepSeek V4 Pro 是為文字+圖像吞吐量激進定價的,不接受影片或音訊。Gemini 3.1 Pro 定位是帶原生影片和音訊支援的完整多模態旗艦——這是不同的輸入面,不是同條件的文字對比。MeshTok 不加任何 markup,你看到的正是各家實驗室發布的價格。
這些價格穩定嗎?
模型廠商會週期性更新掛牌價。本文數字反映的是 2026-07-21 的 MeshTok 目錄。頁面頂部的 updatedDate 標明本文最後審閱時間;線上的事實來源永遠是 https://meshtok.com/models。
最後審閱 2026-07-21,MeshTok Team。所有價格與能力取自審閱當日線上 MeshTok 模型目錄(src/data/models.ts)。本文未做任何延遲、token 數、召回或品質測量——所示數字是從公開掛牌價推導的算術投影,不是實測 benchmark。