2026 年的中国大模型格局已经收敛为一个紧凑的旗舰梯队。四家实验室——智谱、阿里、月之暗面与 DeepSeek——目前发布的模型在上下文、推理与代码能力上已能与西方前沿版本正面抗衡,且价格往往只有零头。本文是一场规格与价格的对决,聚焦如今通过 MeshTok 统一 API 即可调用的四款最具代表性的中国旗舰:GLM-5.2、Qwen3.7 Max、Kimi K2.7 Code 与 DeepSeek V4 Pro。
我们没有跑延迟或质量基准测试。下文每一个数字都来自 src/data/models.ts,用计算器就能复现。本文的目标是帮你在给定工作负载与预算下选出合适的模型——依据的是真正影响路由决策的那几项数据:上下文窗口、能力标签、最大输出,以及每百万 token 的价格。
四位选手:规格速览
这四款模型今日即可通过 https://meshtok.com/v1 调用。其中三款在目录中带有 flagship 能力标签;Kimi K2.7 Code 是不带该标签的代码专精模型,之所以入选,是因为它是月之暗面 2026 年面向开发者最值得关注的一次发布。
| 模型 | 厂商 | 上下文 | 最大输出 | 输入 $/M | 输出 $/M | 发布时间 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek (CN) | 1,000,000 | 32,768 | $0.4286 | $0.8571 | 2026-04 |
| GLM-5.2 | Zhipu (CN) | 1,000,000 | 128,000 | $1.1429 | $4.0000 | 2026-07 |
| Qwen3.7 Max | Alibaba (CN) | 1,000,000 | 8,192 | $0.8571 | $2.5714 | 2026-06 |
| Kimi K2.7 Code | Moonshot (CN) | 256,000 | 8,192 | $0.9286 | $3.8571 | 2026-05 |
能力矩阵
| 能力 | DeepSeek V4 Pro | GLM-5.2 | Qwen3.7 Max | Kimi K2.7 Code |
|---|---|---|---|---|
| Reasoning | ✅ | ✅ | ✅ | — |
| Coding | ✅ | ✅ | ✅ | ✅ |
| Vision (image) | ✅ | — | ✅ | — |
| Tool calling | ✅ | ✅ | ✅ | ✅ |
| JSON mode | ✅ | ✅ | ✅ | ✅ |
| Flagship tag | ✅ | ✅ | ✅ | — |
从这两张表里可以读出三条结构性结论:
- 只有 DeepSeek V4 Pro 与 Qwen3.7 Max 是多模态。 四者中最贵的 GLM-5.2 却没有图像能力。如果你的工作负载里包含截图、示意图或扫描件,价格还来不及上场,候选名单就已经缩到只剩两家。
- GLM-5.2 的 128K 最大输出是独一份。 在场的其他模型输出都卡在 8K–32K。对于需要单轮超长回复的场景——整文件重构、长篇报告、多文件脚手架——GLM-5.2 是唯一不会被截断的选择。
- DeepSeek V4 Pro 双轴最便宜、标签最齐全。 它同时带有
reasoning、coding、image、tools、json与flagship——全集——却在输入与输出价格两端都低于在场的任何其他模型。
价格分析
下文所有数字都是根据 src/data/models.ts 中挂牌价做的算术推算,并非任何真实工作负载的实测值。你的实际账单取决于你真实的提示与回复长度;这里真正有价值的是比例,它稳定且可复现。
每百万输入 + 百万输出 token 的成本
一个粗略的单位:一百万输入 token 加一百万输出 token。
| 模型 | 输入 (1M) | 输出 (1M) | 合计 |
|---|---|---|---|
| DeepSeek V4 Pro | $0.43 | $0.86 | $1.29 |
| Qwen3.7 Max | $0.86 | $2.57 | $3.43 |
| Kimi K2.7 Code | $0.93 | $3.86 | $4.79 |
| GLM-5.2 | $1.14 | $4.00 | $5.14 |
以这个单位计,DeepSeek V4 Pro 比 Qwen3.7 Max 便宜 2.7 倍,比 Kimi K2.7 Code 便宜 3.7 倍,比 GLM-5.2 便宜 4.0 倍。 除 DeepSeek 外,每一款都是输出 token 在主导账单;V4 Pro 的输入与输出价格之比不到 2 倍,平衡得异乎寻常。
一百万次调用(每次 1K 输入 + 500 输出 token)的成本
一个更贴近聊天式流量的单位:一百万次短调用,每次消费 1,000 个输入 token、产出 500 个输出 token。合计即十亿输入 token 与五亿输出 token。
| 模型 | 输入 (1B in) | 输出 (500M out) | 一百万次调用合计 |
|---|---|---|---|
| DeepSeek V4 Pro | $429 | $429 | $857 |
| Qwen3.7 Max | $857 | $1,286 | $2,143 |
| Kimi K2.7 Code | $929 | $1,929 | $2,857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
排序与 1M+1M 单位一致,只有一处值得留意:在聊天式流量下,GLM-5.2 一跃成为四者中最贵(它 $4/M 的输出价格压过一切),反超 Kimi K2.7 Code。一个实际含义——如果你每月在 GLM-5.2 上花 $3,000,而该工作负载并不真正需要它的 128K 输出窗口,那么同样的流量形态换到 DeepSeek V4 Pro 大约只要 $820/月。这笔节省是否值得付出质量上的代价,只有你自己的 eval 能回答;价差足够大,以至于不去测量它就等于把真金白银留在桌上。
该选哪一款
并不存在「最好的中国模型」——只有给定工作负载下合适的模型。把下面这张矩阵作为起点,再用你自己的 eval 验证。
| 工作负载 | 推荐 | 原因 |
|---|---|---|
| 预算敏感的大体量多模态对话 | DeepSeek V4 Pro | 唯一一款输入单价低于 $1/M 且带视觉的模型。在 1K+500 聊天单位上比 Qwen3.7 Max(唯一的另一款多模态选项)便宜约 2.7 倍。 |
| 长文档分析(1M 上下文)、中短输出 | DeepSeek V4 Pro | 1M 上下文 + 32K 最大输出覆盖大多数摘要与问答场景,也是本组里最便宜的 1M 上下文模型。 |
| 需要超长单轮输出(>32K token) | GLM-5.2 | GLM-5.2 的 128K 最大输出独一无二。V4 Pro 在 32K 处截断;Qwen3.7 Max 与 Kimi K2.7 Code 上限是 8K。 |
| 需要最新训练知识的问题 | GLM-5.2 | 知识截止 2026-04,是本组里最新的。适合查询近期事件、API 或库。 |
| 中价位的多模态旗舰、均衡型 | Qwen3.7 Max | 视觉 + 推理 + flagship,价格 $0.86/$2.57。当你想要多模态又不想用 DeepSeek 的画像,或需要阿里的工具生态时的折中之选。 |
| 整仓代码分析、智能体式编码流 | Kimi K2.7 Code | 为长上下文代码理解量身打造。注意 256K 上下文上限,且缺 reasoning/flagship 标签——为代码选它,别为通用推理选它。 |
| 想要 DeepSeek 风味的硬派多步推理 | DeepSeek V4 Pro | 带有 reasoning 与 flagship 且价格最低。对新项目而言,纸面参数上 V4 Pro 已取代较早的 DeepSeek R1 (0528)。 |
一条合理的默认路由策略:把便宜、大体量、多模态的流量送给 DeepSeek V4 Pro;把长输出重构与最新知识查询路由给 GLM-5.2;当你在热路径上需要厂商多样性时,用 Qwen3.7 Max 作为均衡的多模态兜底;把 Kimi K2.7 Code 留给那些仓库级的专属代码任务——在那儿,它的长上下文代码调校才配得上它收的溢价。
如何调用这四款(真实可运行的代码)
MeshTok 暴露了一个 OpenAI 兼容的统一端点 https://meshtok.com/v1。在本文四款模型之间切换,只需改 model 字段这一行——同一套 SDK、同一个 API key、同一种请求格式。下面是目录中真实的模型 ID。
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str) -> str:
"""Same call, different model — switch with one string."""
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
cheap_multimodal = ask("deepseek/deepseek-v4-pro", "Summarize this 200K-token transcript and extract action items.")
long_output = ask("bigmodel/glm-5.2", "Rewrite this 50K-token file with the new API and keep it under 100K tokens.")
balanced_vision = ask("ali/qwen3.7-max", "Describe this screenshot and suggest UI fixes.")
repo_code = ask("moonshot/kimi-k2.7-code", "Analyze this entire repository and list dead code.")
要流式回复,传 stream=True 并迭代分块;要工具调用,传 tools 参数;要结构化输出,用 response_format={"type": "json_object"}。四款模型都支持 tools 与 json,因此请求格式在它们之间完全一致。完整示例(Python、JavaScript 与 cURL)见 MeshTok 流式文档 与 工具调用文档。
常见问题
四者里谁最便宜? DeepSeek V4 Pro,遥遥领先。每百万 token $0.4286/$0.8571,是本组中唯一一款输入与输出单价双双低于 $1/M 的模型。以「百万输入 + 百万输出」为单位计,它比另外三款便宜 2.7–4.0 倍。
谁的上下文窗口最长? 四款中有三款——DeepSeek V4 Pro、GLM-5.2 与 Qwen3.7 Max——同为 1,000,000 token 的上下文窗口。Kimi K2.7 Code 上限是 256,000 token。上下文窗口是模型所接受的声明上界,并非对每一个位置的质量保证——务必在你自己的数据上测一测长上下文表现。
谁的最大输出最长? GLM-5.2,独一份,128,000 token。DeepSeek V4 Pro 提供 32,768;Qwen3.7 Max 与 Kimi K2.7 Code 上限是 8,192。如果你的工作负载会产出超长单轮回复,GLM-5.2 是这里唯一不会被截断的选项。
哪些模型支持视觉(图像输入)? 只有 DeepSeek V4 Pro 与 Qwen3.7 Max。GLM-5.2 与 Kimi K2.7 Code 是纯文本。值得注意的是,GLM-5.2 是四款里最贵的,却偏偏没有图像能力。
为什么本文里没有延迟或质量基准测试?
因为我们没跑,而我们不会发表没法用原始日志背书的数字。延迟取决于时段、区域、提示长度与队列状态;脱离测试框架去给一个 first-token-latency 数字,那是营销而不是数据。没有共享 eval 集的质量对比同样软。上面的价格与能力数据才是稳定、可验证的部分。剩下的部分,请你在 MeshTok 上用 temperature: 0.0 与你自己的提示做一次自己的 eval。
Kimi K2.7 Code 算「旗舰」吗?
不算——它在目录里不带 flagship 能力标签,也缺 reasoning 标签。这里之所以收录,是因为它是月之暗面面向开发者最值得关注的一次发布:一位长上下文代码专精的选手。为代码选它,别为通用推理选它。如果你需要推理能力,月之暗面的通用款 Kimi K2.6 带有 reasoning。
这些价格稳定吗?
模型厂商会周期性更新挂牌价。本文数字反映的是 MeshTok 目录在 2026-08-21 的状态。页面顶部的 updatedDate 标示了本文最近一次复核的时间;唯一永远以之为准的实时来源是 https://meshtok.com/models。
最后复核于 2026-08-21,由 MeshTok Team 出具。所有价格与能力均取自复核当日 MeshTok 实时模型目录(src/data/models.ts)。本文未进行任何延迟、token 计数或质量的实测——所示数字均为基于挂牌价的算术推算,并非实测基准。