2026 年的中文 LLM 戰局已收斂成一個緊密的旗艦梯隊。四家實驗室 —— 智譜、阿里巴巴、Moonshot 與 DeepSeek —— 如今推出的模型在上下文、推理與程式碼能力上已能直接與西方前沿版本正面交鋒,而且價格往往只有幾分之一。本文是一場規格與價格的大對決,涵蓋目前透過 MeshTok 統一 API 可使用的四款最相關的中文旗艦:GLM-5.2、Qwen3.7 Max、Kimi K2.7 Code 與 DeepSeek V4 Pro。
我們並未執行延遲或品質評測。下列每一個數字都來自 src/data/models.ts,而且都可以用計算機驗算。本文的目的是協助你依據工作負載與預算挑選合適的模型 —— 基於對路由決策真正重要的資料:上下文視窗、能力、最大輸出,以及每百萬 token 的價格。
四強對決:規格表
這四款模型目前都可透過 https://meshtok.com/v1 呼叫。其中三款在目錄中帶有 flagship 能力標籤;Kimi K2.7 Code 則是不帶該標籤的程式碼專家,之所以在此納入,是因為它是 Moonshot 在 2026 年最相關的開發者向版本。
| 模型 | 供應商 | 上下文 | 最大輸出 | 輸入 $/M | 輸出 $/M | 發布日期 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek (CN) | 1,000,000 | 32,768 | $0.4286 | $0.8571 | 2026-04 |
| GLM-5.2 | Zhipu (CN) | 1,000,000 | 128,000 | $1.1429 | $4.0000 | 2026-07 |
| Qwen3.7 Max | Alibaba (CN) | 1,000,000 | 8,192 | $0.8571 | $2.5714 | 2026-06 |
| Kimi K2.7 Code | Moonshot (CN) | 256,000 | 8,192 | $0.9286 | $3.8571 | 2026-05 |
能力矩陣
| Capability | DeepSeek V4 Pro | GLM-5.2 | Qwen3.7 Max | Kimi K2.7 Code |
|---|---|---|---|---|
| Reasoning | ✅ | ✅ | ✅ | — |
| Coding | ✅ | ✅ | ✅ | ✅ |
| Vision (image) | ✅ | — | ✅ | — |
| Tool calling | ✅ | ✅ | ✅ | ✅ |
| JSON mode | ✅ | ✅ | ✅ | ✅ |
| Flagship tag | ✅ | ✅ | ✅ | — |
從這兩張表可以歸納出三個結構性觀察:
- 只有 DeepSeek V4 Pro 與 Qwen3.7 Max 具備多模態能力。 GLM-5.2 —— 四者中最貴的 —— 沒有影像能力。若你的工作負載包含螢幕截圖、圖表或掃描文件,在價格還沒上桌之前,候選就只剩兩款。
- GLM-5.2 的 128K 最大輸出是獨一無二的。 其他每一款模型的輸出上限都落在 8K–32K 之間。對於需要產出極長單輪回應的工作負載 —— 整檔重構、長篇報告、多檔鷹架生成 —— GLM-5.2 是唯一不會被截斷的選項。
- DeepSeek V4 Pro 在兩軸上都是最便宜,在標籤上也最完整。 它帶有
reasoning、coding、image、tools、json與flagship—— 完整一套 —— 卻在輸入與輸出價格上都低於此處的每一款其他模型。
價格分析
以下所有數字都是依 src/data/models.ts 中的牌價做算術推算而得。它們不是任何真實工作負載的實測值。你實際的帳單取決於你真實的提示與回應長度;這裡的價值在於比值,而比值是穩定且可重現的。
每百萬輸入 + 百萬輸出 token 的成本
一個粗估的單位:一百萬輸入 token 加上一百萬輸出 token。
| 模型 | 輸入 (1M) | 輸出 (1M) | 合計 |
|---|---|---|---|
| DeepSeek V4 Pro | $0.43 | $0.86 | $1.29 |
| Qwen3.7 Max | $0.86 | $2.57 | $3.43 |
| Kimi K2.7 Code | $0.93 | $3.86 | $4.79 |
| GLM-5.2 | $1.14 | $4.00 | $5.14 |
以這個單位來看,DeepSeek V4 Pro 比 Qwen3.7 Max 便宜 2.7 倍,比 Kimi K2.7 Code 便宜 3.7 倍,比 GLM-5.2 便宜 4.0 倍。 對 DeepSeek 以外的每一款模型而言,輸出 token 主導了整筆帳單 —— 對 V4 Pro 來說,輸入與輸出價格落在 2 倍比例內,這是相當罕見的平衡。
100 萬次呼叫 @ 1K 輸入 + 500 輸出 token 的成本
對聊天型流量更貼切的單位:一百萬次短呼叫,每次消耗 1,000 個輸入 token、產生 500 個輸出 token。合計為 10 億個輸入 token 與 5 億個輸出 token。
| 模型 | 輸入 (1B) | 輸出 (500M) | 100 萬次呼叫合計 |
|---|---|---|---|
| DeepSeek V4 Pro | $429 | $429 | $857 |
| Qwen3.7 Max | $857 | $1,286 | $2,143 |
| Kimi K2.7 Code | $929 | $1,929 | $2,857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
排序與 1M+1M 單位一致,只有一個值得注意的變化:在聊天型流量上,GLM-5.2 跌到四款中最貴(其 $4/M 輸出價格主導了成本),超越了 Kimi K2.7 Code。實際的啟示是 —— 若你每月花 $3,000 在 GLM-5.2 上,而工作負載並未特別需要它的 128K 輸出視窗,那麼同樣的流量形狀在 DeepSeek V4 Pro 上大約只需 $820/月。至於這筆節省是否值得換取品質的折衷,只有你自己的評測能回答;價差大到一個程度,不量測它就等於把真金白銀留在桌上了。
該挑哪一款:情境對照
世上沒有「最佳中文模型」—— 只有對某個工作負載而言正確的模型。把這張對照表當作起點,並用自己的評測來驗證。
| 工作負載 | 推薦 | 為什麼 |
|---|---|---|
| 預算有限的高量多模態聊天 | DeepSeek V4 Pro | 此處唯一輸入低於 $1/1M 且具備視覺的模型。在 1K+500 聊天單位上,比 Qwen3.7 Max(另一個多模態選項)便宜約 2.7 倍。 |
| 長文件分析(1M 上下文)、中短輸出 | DeepSeek V4 Pro | 1M 上下文 + 32K 最大輸出,足以涵蓋大多數摘要與問答。此群組中 1M 上下文最便宜的模型。 |
| 需要極長單輪輸出(>32K token)的工作負載 | GLM-5.2 | GLM-5.2 的 128K 最大輸出在此獨一無二。V4 Pro 在 32K 截斷;Qwen3.7 Max 與 Kimi K2.7 Code 上限為 8K。 |
| 需要最新訓練知識的問題 | GLM-5.2 | 知識截止 2026-04,為此群組中最新的。適合用於查詢近期事件、API 或函式庫。 |
| 均衡的中價位多模態旗艦 | Qwen3.7 Max | 在 $0.86/$2.57 上具備視覺 + 推理 + 旗艦。當你想要多模態但不選 DeepSeek,或需要阿里巴巴工具生態系時的中間選擇。 |
| 整個程式庫的程式碼分析、代理式編碼流程 | Kimi K2.7 Code | 專為長上下文程式碼理解打造。注意其 256K 上下文上限與缺少 reasoning/flagship 標籤 —— 為程式碼挑它,而非一般推理。 |
| 需要 DeepSeek 風格的硬性多步推理 | DeepSeek V4 Pro | 在最低價位上帶有 reasoning 與 flagship。對新專案而言,V4 Pro 在規格上已取代舊版 DeepSeek R1 (0528)。 |
四款之間一個合理的預設路由策略:把便宜、高量、多模態的流量送至 DeepSeek V4 Pro;把長輸出重構與新鮮知識查詢路由至 GLM-5.2;當你想要在熱路徑上維持供應商多樣性時,把 Qwen3.7 Max 當作均衡的多模態備援;把 Kimi K2.7 Code 保留給專屬的程式庫規模程式碼任務,在那裡它的長上下文程式碼調校才配得上它的溢價。
如何呼叫這四款(真實、可執行的程式碼)
MeshTok 在 https://meshtok.com/v1 暴露單一個與 OpenAI 相容的端點。在本文任何一款模型之間切換,只需改 model 欄位這一行 —— 同一個 SDK、同一把 API key、同一個請求格式。以下模型 ID 都是來自目錄的真實 ID。
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str) -> str:
"""Same call, different model — switch with one string."""
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
cheap_multimodal = ask("deepseek/deepseek-v4-pro", "Summarize this 200K-token transcript and extract action items.")
long_output = ask("bigmodel/glm-5.2", "Rewrite this 50K-token file with the new API and keep it under 100K tokens.")
balanced_vision = ask("ali/qwen3.7-max", "Describe this screenshot and suggest UI fixes.")
repo_code = ask("moonshot/kimi-k2.7-code", "Analyze this entire repository and list dead code.")
若要串流回應,傳入 stream=True 並逐一迭代分塊;若要工具呼叫,傳入 tools 引數;若要結構化輸出,使用 response_format={"type": "json_object"}。這四款模型都支援 tools 與 json,因此請求格式在它們之間完全一致。完整的 Python、JavaScript 與 cURL 範例請見 MeshTok 串流文件 與工具呼叫文件。
常見問答
這四款中哪一款最便宜? DeepSeek V4 Pro,差距相當大。在每百萬 token $0.4286/$0.8571 的價位下,它是此群組中唯一輸入與輸出雙雙低於 $1/M 的模型。以 1M 輸入加 1M 輸出的單位計算,它比其他三款便宜 2.7–4.0 倍。
哪一款的上下文視窗最長? 四款中有三款 —— DeepSeek V4 Pro、GLM-5.2 與 Qwen3.7 Max —— 共用 1,000,000 token 的上下文視窗。Kimi K2.7 Code 上限為 256,000 token。上下文視窗是模型所接受的上限宣告值,並非對每個位置都保證品質 —— 務必在自己的資料上測試長上下文行為。
哪一款的最大輸出最長? GLM-5.2,獨家,128,000 token。DeepSeek V4 Pro 提供 32,768;Qwen3.7 Max 與 Kimi K2.7 Code 上限為 8,192。如果你的工作負載會產出極長的單輪回應,GLM-5.2 是此處唯一不會被截斷的選項。
哪幾款支援視覺(image 輸入)? 只有 DeepSeek V4 Pro 與 Qwen3.7 Max。GLM-5.2 與 Kimi K2.7 Code 僅支援文字。值得注意的是,GLM-5.2 是四款中最貴的,卻缺少影像能力。
為什麼本文沒有延遲或品質評測?
因為我們沒有跑任何評測,而且我們不打算發布無法用原始紀錄佐證的數字。延遲取決於時段、地區、提示長度與佇列狀態;一個沒有測試框架背書的首 token 延遲數字是行銷,不是資料。沒有共享評測集的品質比較同樣站不住腳。上方的價格與能力資料才是穩定且可驗證的部分。其餘部分,請自己在 MeshTok 上用 temperature: 0.0 與自己的提示跑評測。
Kimi K2.7 Code 真的算「旗艦」嗎?
不算 —— 它在目錄中並不帶有 flagship 能力標籤,也缺少 reasoning 標籤。它之所以在此收錄,是因為它是 Moonshot 最相關的開發者向版本:一款長上下文程式碼專家。為程式碼挑它,而非一般推理。若你需要推理,Moonshot 的通用款 Kimi K2.6 帶有 reasoning。
這些價格穩定嗎?
模型供應商會定期更新牌價。此處數字反映 2026-08-21 當下的 MeshTok 目錄。頁面頂端的 updatedDate 告訴你本文最後審閱於何時;即時的真相來源一律是 https://meshtok.com/models。
最後審閱於 2026-08-21,由 MeshTok 團隊執行。所有價格與能力皆取自審閱當日即時的 MeshTok 模型目錄(src/data/models.ts)。本文未進行任何延遲、token 計數或品質量測 —— 所列數字皆為依公開牌價推算的算術投影,並非實測評比。