MeshTok 目录里收录了十多款上下文窗口在百万 token 以上的模型。它们几乎都为了达到这个量级而有所妥协——没有视觉、没有视频、没有音频、最大输出受限,或者缺少 flagship 标签。Gemini 3.1 Pro 是个例外:1,048,576 token 的上下文窗口、65,536 token 的最大输出、原生图像+视频+音频输入,外加 reasoning、tools、json 和 flagship 标签,全部集中在一个模型 ID 里。本文要回答的问题是:这套组合是否配得上每百万 token $2 / $12 的定价。
这是一篇规格与定价分析,不是合成 benchmark。我们没有跑延迟测试,没有测各上下文位置上的”大海捞针”召回率,也不会发布任何无法用线上目录数据背书的数字。下文每一个数字都是你用计算器从 src/data/models.ts 就能复现的算术。目标是帮你判断 Gemini 3.1 Pro 的百万 token 窗口是否值得在你路由层里占据一席之地——判断依据是对预算真正关键的数据:上下文窗口、最大输出、多模态覆盖、每百万 token 价格。
在进入数字之前先说一句实话:目录里的模型 ID 是 google/gemini-3.1-pro-preview。这个 -preview 后缀来自源数据,我们不会把它藏起来。规格表可以视为准确,但在锁定生产路由决策之前,请对照 https://meshtok.com/v1/models 再核对一次。
Gemini 3.1 Pro:规格表
现在通过 MeshTok 统一 API(https://meshtok.com/v1),使用模型 ID google/gemini-3.1-pro-preview 即可调用。
| 字段 | 取值 |
|---|---|
| 厂商 | Google(美国) |
| 上下文窗口 | 1,048,576 token(2²⁰,略高于 1M) |
| 最大输出 | 65,536 token |
| 输入价格(每百万 token) | $2.00 |
| 输出价格(每百万 token) | $12.00 |
| 能力标签 | image, video, audio, reasoning, tools, json, flagship |
| 发布时间 | 2026-06 |
| 知识截止 | 2026-05 |
这一档上有三点尤其突出:
- 目录中多模态模型里最大的”上下文+输出”合计窗口。 1,048,576 输入 + 65,536 输出意味着一次调用可以吞下大约百万 token 的混合文本、图像、音频、视频,并吐出 65K token 的响应。
models.ts里再没有其他模型能同时满足这三项:1M+ 上下文、65K+ 最大输出、以及 image+video+audio 输入。 - 完整原生多模态,含视频和音频。 多数 1M 上下文竞品止步于
image(DeepSeek V4 Pro、Qwen3.7 Max、Doubao Seed 2.1 Pro),甚至直接砍掉视觉(GLM-5.2)。Gemini 3.1 Pro 是目录里唯一在 1M 上下文旗舰档原生接收视频和音频的模型,与文本和图像并列。 - 带
flagship与reasoning标签。 Google 给它贴的是为前沿档保留的能力标签。更便宜的 Gemini Flash 变体贴的是fast而不是reasoning和flagship——这就是家族内部的结构性分界。
百万 token 之问:1M 上下文到底要花多少钱?
这是大多数营销页会跳过的部分。百万 token 的上下文窗口是一笔预算,不是免费午餐。你放进去的每个 token 都按输入价计费。比较长上下文模型的正确做法是算”实际把窗口用满”的成本。
一次满载调用的成本(1M 输入 + 简短摘要)
典型的长上下文负载:送进约 1M token 的文档,要一份简短摘要或几条行动项。我们假设输入 1,048,576 token、输出 1,000 token。
| 模型 | 输入成本 | 输出成本 | 单次调用合计 |
|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | $0.012 | $2.109 |
| Gemini 2.5 Pro | $1.311 | $0.010 | $1.321 |
| Gemini 3 Flash | $0.524 | $0.003 | $0.527 |
| DeepSeek V4 Pro | $0.449 | $0.001 | $0.450 |
| GLM-5.2 | $1.143 | $0.004 | $1.147 |
| Claude Sonnet 5 | $3.000 | $0.015 | $3.015 |
一次满载的 Gemini 3.1 Pro 调用大约 $2.11。一天跑一千次,光输入 token 就是 $2,109/天——大约 $63K/月。这不是让你回避这个模型的理由,而是提醒你什么时候才真正需要把窗口用满要慎重。
满载长输出调用的成本(1M 输入 + 用满最大输出)
Gemini 3.1 Pro 的定价结构真正区别于其他模型的场景,是连最大输出也一起用满的情况。这里假设上下文塞到上限,并允许模型输出它的完整最大输出。
| 模型 | 1M 输入 | 用满的最大输出 | 输出成本 | 单次调用合计 |
|---|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | 65,536 | $0.786 | $2.883 |
| GLM-5.2 | $1.143 | 128,000 | $0.512 | $1.655 |
| DeepSeek V4 Pro | $0.449 | 32,768 | $0.028 | $0.477 |
| Claude Sonnet 5 | $3.000 | 16,384 | $0.246 | $3.246 |
GLM-5.2 单次满载调用更便宜,是因为它的最大输出有 128K,但定价是 $4/1M 而不是 $12/1M。Gemini 3.1 Pro 和 GLM-5.2 之间的决定因素不是价格——而是你是否需要视频和音频输入,GLM-5.2 完全不接受这两类输入。
一百万次短对话调用的成本(每次 1K 输入 + 500 输出)
在另一个极端做个 sanity check:一百万次短调用,每次消耗 1,000 输入 token、产出 500 输出 token。汇总下来是 10 亿输入 token、5 亿输出 token。
| 模型 | 输入成本(10 亿 in) | 输出成本(5 亿 out) | 100 万次调用合计 |
|---|---|---|---|
| Gemini 3.1 Pro | $2,000 | $6,000 | $8,000 |
| Gemini 2.5 Pro | $1,250 | $5,000 | $6,250 |
| Gemini 3 Flash | $500 | $1,500 | $2,000 |
| DeepSeek V4 Pro | $429 | $429 | $857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
| Claude Sonnet 5 | $3,000 | $7,500 | $10,500 |
在短对话流量上,Gemini 3.1 Pro 大约比 DeepSeek V4 Pro 贵 9.3 倍、比 GLM-5.2 贵 2.5 倍。教训很直白:百万 token 窗口是高端特性,不应该为根本用不到它的流量买单。
Gemini 家族内部:选哪个?
MeshTok 目录里有 7 款上下文窗口达到 1M 级别的 Gemini 模型。选哪个,本质上是推理深度、多模态覆盖、价格之间的取舍。
| 模型 | 上下文 | 最大输出 | 输入 $/M | 输出 $/M | 视频 | 音频 | 推理 | 旗舰 |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 2.5 Pro | 1,048,576 | — | $1.25 | $10.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 3.5 Flash | 1,048,576 | 65,536 | $1.50 | $9.00 | ✅ | ✅ | — | — |
| Gemini 3 Flash | 1,048,576 | 65,536 | $0.50 | $3.00 | ✅ | ✅ | — | — |
| Gemini 3.1 Flash Lite | 1,048,576 | — | $0.25 | $1.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash | 1,048,576 | — | $0.30 | $2.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash Lite | 1,000,000 | — | $0.10 | $0.40 | ✅ | ✅ | — | — |
怎么读这张表:
- Gemini 3.1 Pro vs Gemini 2.5 Pro——2.5 Pro 是上一代旗舰,两个轴都更便宜($1.25/$10 对 $2/$12)。多花钱买 3.1 Pro 的理由:明确的 65,536 最大输出(2.5 Pro 在目录里没有显式
maxOutput)、更新的知识截止(2026-05)、更新的 3.1 世代。继续留在 2.5 Pro 的理由:如果你不需要这几项,它就严格更便宜。 - Gemini 3.1 Pro vs Gemini 3 Flash——Flash 是 1/4 的价格,共享同样的 1M 上下文、65K 最大输出和完整多模态输入。你放弃的是
reasoning和flagship。对不需要逐步推理的高并发多模态分类、转写、路由任务,Flash 是正确的选择。但凡能从推理链受益——多步分析、需要综合的长文档问答——3.1 Pro 就是升级方向。 - Gemini 3.1 Pro vs Gemini 3.1 Flash Lite / 2.5 Flash Lite——Lite 系是预算档。保留了 1M 上下文和多模态输入,但去掉了推理和显式最大输出上限。当你需要便宜地吃下大量 token、且对响应质量门槛中等时,就用它们。
Gemini 3.1 Pro vs 其他 1M 上下文旗舰
Gemini 3.1 Pro 和其他实验室更知名的 1M 上下文旗舰相比如何?
| 模型 | 上下文 | 最大输出 | 输入 $/M | 输出 $/M | 视频 | 音频 | 发布 |
|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | 2026-06 |
| DeepSeek V4 Pro | 1,000,000 | 32,768 | $0.4286 | $0.8571 | — | — | 2026-04 |
| GLM-5.2 | 1,000,000 | 128,000 | $1.1429 | $4.0000 | — | — | 2026-07 |
| Qwen3.7 Max | 1,000,000 | 8,192 | $0.8571 | $2.5714 | — | — | 2026-06 |
| Claude Sonnet 5 | 1,000,000 | 16,384 | $3.0000 | $15.0000 | — | — | 2026-05 |
| Claude Opus 4.8 | 1,000,000 | 32,000 | $5.0000 | $25.0000 | — | — | 2026-06 |
两点结构性观察:
- Gemini 3.1 Pro 是这张表里唯一带原生视频和音频输入的模型。 其他 1M 上下文旗舰最多只能接受图像。如果你的负载是视频理解、会议转写,或任何把音视频和文本一起送进的 pipeline,Gemini 3.1 Pro 不是更便宜的选项——而是 1M 上下文档里唯一的选项。
- GLM-5.2 最大输出最长(128K),但完全没有多模态。 如果你的负载需要从纯文本输入生成超长的单轮文本响应,GLM-5.2 既更便宜也有更长的输出窗口。一旦需要图像、视频或音频,GLM-5.2 就出局,Gemini 3.1 Pro 重新进入讨论。
长上下文 vs RAG 的取舍(坦诚版)
“百万 token 窗口值不值”这个问题,几乎总是归约成成本问题,而不是能力问题。1M 上下文让你可以跳过检索 pipeline,把所有东西一股脑塞进 prompt。这很方便,但在 $2/1M 输入的价位上每次调用都很贵——而且下一次调用还要再付一次,因为上下文窗口不会免费缓存。
完全从上面定价推导出的一条简单经验法则:
- 如果同一个大语料会被反复查询,检索更便宜。送 5K 检索 token 按 $2/1M = 每次调用 $0.01,对比 1M token 按 $2/1M = 每次调用 $2.00。每跑一次完整上下文调用,对应大约 200 次纯检索调用才会回本。
- 如果语料只查一两次就丢掉(新转写稿的一次性摘要、合同的精读一次、对代码库的临时探索),长上下文就是正确的工具。检索系统的搭建成本会比它省下的 token 还高。
- 如果需要在长时间跨度上做音频或视频理解(2 小时的会议录音、长视频),Gemini 3.1 Pro 是目录里唯一把这种输入模态和 1M 窗口结合的模型。1M 档内没有更便宜的替代——取舍是在 Gemini 3.1 Pro 和”更短上下文模型+分块”之间。
什么时候选 Gemini 3.1 Pro(什么时候不选)
不存在”最好的模型”——只有针对给定负载和预算的合适模型。把这张表作为起点,再用你自己的 eval 校验。
| 负载 | 推荐 | 原因 |
|---|---|---|
| 长视频或长音频理解(媒体量 1M+ token) | Gemini 3.1 Pro | 目录里唯一带原生 video 和 audio 输入的 1M 上下文模型。这一档没有更便宜的替代。 |
| 混合多模态长上下文分析(文本+图像+音频) | Gemini 3.1 Pro | 唯一把 1M 上下文、65K 最大输出、完整多模态输入合一的旗舰。 |
| 超长输出(>65K,最高 128K)的纯文本长上下文 | GLM-5.2 | GLM-5.2 的 128K 最大输出是独一份。满载长输出调用更便宜。无视觉。 |
| 预算有限、高并发的 1M 上下文多模态 | Gemini 3 Flash | 3.1 Pro 的 1/4 价格,相同 1M 上下文、相同多模态输入。去掉了推理。 |
| 尽可能便宜的 1M 上下文(文本或图像) | DeepSeek V4 Pro | $0.43/1M 输入——比 Gemini 3.1 Pro 输入便宜 4.7 倍。无视频/音频。 |
| 顶级代码质量,成本其次 | Claude Sonnet 5 | Anthropic 的定位和社区评测把 Sonnet 5 放在代码任务第一档。如果多模态长上下文更重要,则用 Gemini 3.1 Pro。 |
| 不需要多模态的长上下文分析推理 | GLM-5.2 或 DeepSeek V4 Pro | 两者在纯文本长上下文任务上都更便宜。要长输出选 GLM-5.2,要最低成本选 V4 Pro。 |
一个合理的默认路由策略:把任何含视频或音频的调用路由到 Gemini 3.1 Pro;把超长输出的纯长文本重构路由到 GLM-5.2;把低成本、高并发的文本+图像流量路由到 DeepSeek V4 Pro;把 Claude Sonnet 5 留给高风险代码任务。Gemini 3.1 Pro 是多模态长上下文的专家模型,不是一切的默认。
如何调用 Gemini 3.1 Pro(真实可运行的代码)
MeshTok 在 https://meshtok.com/v1 暴露一个 OpenAI 兼容端点。在 Gemini 3.1 Pro 和本文其他模型之间切换,只需改 model 字段一行——同一套 SDK、同一个 API key、同一种请求格式。下面的示例展示长上下文多模态的写法:一段长文本 prompt 加一个图片 URL,作为一次调用发出。
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
"""Same call, different model and modality — switch with one string."""
content = [{"type": "text", "text": prompt}]
if image_url:
content.append({"type": "image_url", "image_url": {"url": image_url}})
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": content}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
multimodal_long = ask("google/gemini-3.1-pro-preview",
"Summarize this 800K-token transcript and extract action items.",
image_url="https://example.com/chart.png")
text_only_long = ask("bigmodel/glm-5.2",
"Rewrite this 50K-token file with the new API.")
cheap_long = ask("deepseek/deepseek-v4-pro",
"Summarize this 200K-token document.")
coding_flagship = ask("anthropic/claude-sonnet-5",
"Refactor this Python function and add tests.")
流式、工具调用、JSON 模式、图像输入的用法都一样——改 model 字符串、加上相关参数即可。流式响应传 stream=True;工具调用传 tools 参数;结构化输出用 response_format={"type": "json_object"}。Python、JavaScript、cURL 的完整示例见 MeshTok 流式文档 和 工具调用文档。
FAQ
Gemini 3.1 Pro 真的是唯一带视频和音频输入的 1M 上下文模型吗?
截至 2026-07-21,是的。src/data/models.ts 里上下文窗口达到 1M+ 的其他所有模型——DeepSeek V4 Pro、DeepSeek V4 Flash、GLM-5.2、Qwen3.7 Max/Plus、Qwen3.5 Plus/Flash、Qwen3.6 Plus、Claude Sonnet 5、Claude Opus 4.6/4.7/4.8、MiniMax M3、Longcat 2.0、Mimo V2 Pro/V2.5——要么只接受文本,要么只接受文本加图像。没有一款带 video 或 audio 能力标签。带原生视频/音频输入的只有 Gemini 家族自己。
为什么本文没有延迟或召回 benchmark? 因为我们没跑,也不会发布无法用原始日志背书的数字。长上下文召回(“大海捞针”问题)取决于 prompt 形态、位置、语言,以及模型在每个深度上的注意力行为——没有测试框架、prompt 和原始输出做支撑,单一一个召回百分比是营销,不是数据。如果你需要针对自己负载的召回数字,就在 MeshTok 上用你自己的语料自己跑。上面的定价和能力数据才是稳定可验证的部分。
模型 ID 里的 -preview 后缀是个问题吗?
它是个信号,不是阻塞项。Google 在目录里把 3.1 Pro 作为 preview 模型发布(google/gemini-3.1-pro-preview)。这通常意味着规格表是准确的,但模型可能在不改版本号的情况下调整行为。对稳定性要求高于最新能力的生产路由场景,Gemini 2.5 Pro 是价格更低的非 preview 旗舰替代。
Gemini 3.1 Pro 和 Gemini 2.5 Pro 比如何?
2.5 Pro 是 Google 上一代旗舰。它更便宜($1.25/$10 对 $2/$12),带同样的 flagship + reasoning + 完整多模态标签,上下文窗口同样是 1,048,576。多花钱买 3.1 Pro 的理由:明确的 65,536 最大输出、更新的知识截止(2026-05)、更新的 3.1 世代。继续留在 2.5 Pro 的理由:如果你不需要这三项,它就严格更便宜。
Gemini 3.1 Pro 支持工具调用和结构化输出吗?
支持。capabilities 字段里列出了 tools 和 json,意味着原生函数调用和 JSON 模式结构化输出都通过 MeshTok 的 OpenAI 兼容端点支持。请求格式和 OpenAI 完全一致——只有 model 字段不同。
1M 上下文窗口是真实的还是营销?
它是 src/data/models.ts 里声明的上下文窗口,从 Google 自己的模型卡同步而来。实际可用上下文取决于你的 prompt 形态、检索策略,以及模型如何处理长上下文注意力——这些都应该在你自己的数据上测。目录里的数字是模型接受的上限,不是每个位置上的质量保证。
为什么 Gemini 3.1 Pro 比 DeepSeek V4 Pro 贵这么多? 成本结构和能力都不同。DeepSeek V4 Pro 是为文本+图像体量激进定价的,不接受视频或音频。Gemini 3.1 Pro 定位是带原生视频和音频支持的完整多模态旗舰——这是不同的输入面,不是同条件的文本对比。MeshTok 不加任何 markup,你看到的正是各家实验室发布的价格。
这些价格稳定吗?
模型厂商会周期性更新挂牌价。本文数字反映的是 2026-07-21 的 MeshTok 目录。页面顶部的 updatedDate 标明本文最后审阅时间;线上的事实来源永远是 https://meshtok.com/models。
最后审阅 2026-07-21,MeshTok Team。所有价格与能力取自审阅当日线上 MeshTok 模型目录(src/data/models.ts)。本文未做任何延迟、token 数、召回或质量测量——所示数字是从公开挂牌价推导的算术投影,不是实测 benchmark。