O panorama de LLMs chineses em 2026 comprimiu-se numa camada flagship restrita. Quatro laboratórios — Zhipu, Alibaba, Moonshot e DeepSeek — lançam agora modelos que competem diretamente com os lançamentos de fronteira ocidentais em contexto, raciocínio e código, muitas vezes por uma fração do preço. Este artigo é um confronto de especificações e preços dos quatro flagships chineses mais relevantes disponíveis hoje através da API unificada MeshTok: GLM-5.2, Qwen3.7 Max, Kimi K2.7 Code e DeepSeek V4 Pro.
Não executámos benchmarks de latência nem de qualidade. Todos os números abaixo provêm de src/data/models.ts e são reproduzíveis com uma calculadora. O objetivo é ajudar a escolher o modelo certo para uma dada carga de trabalho e orçamento — com base nos dados que realmente importam para decisões de encaminhamento: janela de contexto, capacidades, saída máxima e preço por milhão de tokens.
Os quatro contendores: ficha técnica
Todos os quatro modelos são invocáveis hoje em https://meshtok.com/v1. Três deles ostentam a etiqueta de capacidade flagship no catálogo; o Kimi K2.7 Code é um especialista de código sem essa etiqueta, incluído aqui por ser o lançamento de 2026 mais relevante da Moonshot voltado para programadores.
| Modelo | Fornecedor | Contexto | Saída máxima | Entrada $/M | Saída $/M | Lançado |
|---|---|---|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek (CN) | 1,000,000 | 32,768 | $0.4286 | $0.8571 | 2026-04 |
| GLM-5.2 | Zhipu (CN) | 1,000,000 | 128,000 | $1.1429 | $4.0000 | 2026-07 |
| Qwen3.7 Max | Alibaba (CN) | 1,000,000 | 8,192 | $0.8571 | $2.5714 | 2026-06 |
| Kimi K2.7 Code | Moonshot (CN) | 256,000 | 8,192 | $0.9286 | $3.8571 | 2026-05 |
Matriz de capacidades
| Capacidade | DeepSeek V4 Pro | GLM-5.2 | Qwen3.7 Max | Kimi K2.7 Code |
|---|---|---|---|---|
| Reasoning | ✅ | ✅ | ✅ | — |
| Coding | ✅ | ✅ | ✅ | ✅ |
| Visão (image) | ✅ | — | ✅ | — |
| Chamada de ferramentas | ✅ | ✅ | ✅ | ✅ |
| Modo JSON | ✅ | ✅ | ✅ | ✅ |
| Etiqueta flagship | ✅ | ✅ | ✅ | — |
Três observações estruturais a partir destas duas tabelas:
- Apenas o DeepSeek V4 Pro e o Qwen3.7 Max são multimodais. O GLM-5.2 — o mais caro dos quatro — não tem capacidade de imagem. Se a sua carga de trabalho incluir capturas de ecrã, diagramas ou documentos digitalizados, o campo reduz-se a dois antes de o preço entrar sequer na conversa.
- A saída máxima de 128K do GLM-5.2 é única. Todos os outros modelos aqui limitam-se a 8K–32K de saída. Para cargas de trabalho que precisam de emitir respostas num único turno muito longas — refatorações de ficheiros completos, relatórios longos, scaffolding multi-ficheiro — o GLM-5.2 é a única opção que não truncará.
- O DeepSeek V4 Pro é o mais barato em ambos os eixos e o mais completo em etiquetas. Ostenta
reasoning,coding,image,tools,jsoneflagship— o conjunto completo — e ainda assim bate o preço de todos os outros modelos aqui presentes, tanto na entrada como na saída.
Análise de preços
Todas as figuras abaixo são projeções aritméticas dos preços de lista em src/data/models.ts. Não são medições de nenhuma carga de trabalho real. A sua fatura real depende dos comprimentos reais dos seus prompts e respostas; o valor aqui está na proporção, que é estável e reproduzível.
Custo por 1M de tokens de entrada + 1M de saída
Uma unidade de cálculo aproximado: um milhão de tokens de entrada e um milhão de tokens de saída.
| Modelo | Entrada (1M) | Saída (1M) | Total |
|---|---|---|---|
| DeepSeek V4 Pro | $0.43 | $0.86 | $1.29 |
| Qwen3.7 Max | $0.86 | $2.57 | $3.43 |
| Kimi K2.7 Code | $0.93 | $3.86 | $4.79 |
| GLM-5.2 | $1.14 | $4.00 | $5.14 |
Nesta unidade, o DeepSeek V4 Pro é 2,7× mais barato do que o Qwen3.7 Max, 3,7× mais barato do que o Kimi K2.7 Code e 4,0× mais barato do que o GLM-5.2. Os tokens de saída dominam a fatura de todos os modelos exceto o DeepSeek — no V4 Pro, os preços de entrada e de saída situam-se dentro de uma proporção de 2×, o que é invulgarmente equilibrado.
Custo de 1M de chamadas @ 1K de entrada + 500 tokens de saída
Uma unidade mais realista para tráfego do tipo chat: um milhão de chamadas curtas, cada uma consumindo 1.000 tokens de entrada e produzindo 500 tokens de saída. Isso totaliza mil milhões de tokens de entrada e 500 milhões de tokens de saída.
| Modelo | Entrada (1B) | Saída (500M) | Total para 1M de chamadas |
|---|---|---|---|
| DeepSeek V4 Pro | $429 | $429 | $857 |
| Qwen3.7 Max | $857 | $1,286 | $2,143 |
| Kimi K2.7 Code | $929 | $1,929 | $2,857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
A ordenação é consistente com a unidade de 1M+1M, com uma alteração notória: em tráfego do tipo chat, o GLM-5.2 torna-se o mais caro dos quatro (o seu preço de saída de $4/M domina), ultrapassando o Kimi K2.7 Code. Uma implicação prática — se gasta $3.000/mês em GLM-5.2 para uma carga de trabalho que não precisa especificamente da sua janela de saída de 128K, o mesmo formato de tráfego no DeepSeek V4 Pro custaria aproximadamente $820/mês. Se essa poupança compensa o trade-off de qualidade é uma questão que só a sua própria avaliação pode responder; a diferença de preço é grande o suficiente para que não a medir deixe dinheiro real em cima da mesa.
Quando escolher qual
Não existe “melhor modelo chinês” — apenas o modelo certo para uma dada carga de trabalho. Use esta matriz como ponto de partida e valide com a sua própria avaliação.
| Carga de trabalho | Recomendado | Porquê |
|---|---|---|
| Chat multimodal de alto volume com orçamento reduzido | DeepSeek V4 Pro | Único modelo aqui abaixo de $1/1M de entrada com visão. ~2.7× mais barato do que o Qwen3.7 Max (a única outra opção multimodal) numa unidade de chat de 1K+500. |
| Análise de documentos longos (contexto de 1M), saída curta a média | DeepSeek V4 Pro | Contexto de 1M + 32K de saída máxima cobre a maioria dos resumos e Q&A. O modelo mais barato com contexto de 1M do grupo. |
| Cargas de trabalho que precisam de saída num único turno muito longa (>32K tokens) | GLM-5.2 | A saída máxima de 128K do GLM-5.2 é única aqui. O V4 Pro trunca nos 32K; o Qwen3.7 Max e o Kimi K2.7 Code limitam-se a 8K. |
| Perguntas que precisam do conhecimento de treino mais recente | GLM-5.2 | Corte de conhecimento em 2026-04, o mais recente do grupo. Útil para consultas sobre eventos, APIs ou bibliotecas recentes. |
| Flagship multimodal equilibrado, preço médio | Qwen3.7 Max | Visão + reasoning + flagship a $0.86/$2.57. O meio-termo quando se quer multimodalidade sem o perfil do DeepSeek, ou se precisa do ecossistema de ferramentas da Alibaba. |
| Análise de código de repositório inteiro, fluxos de programação agentic | Kimi K2.7 Code | Construído de propósito para compreensão de código de contexto longo. Note o limite de contexto de 256K e a ausência das etiquetas reasoning/flagship — escolha-o para código, não para raciocínio geral. |
| Raciocínio multi-etapa difícil onde se quer o estilo do DeepSeek | DeepSeek V4 Pro | Ostenta reasoning e flagship ao preço mais baixo. Para projetos novos, o V4 Pro substitui, em teoria, o antigo DeepSeek R1 (0528). |
Uma política de encaminhamento por defeito razoável para os quatro: enviar o tráfego multimodal barato, de alto volume, para o DeepSeek V4 Pro; encaminhar refatorações de saída longa e consultas de conhecimento recente para o GLM-5.2; usar o Qwen3.7 Max como fallback multimodal equilibrado quando se quer diversidade de fornecedor num caminho de tráfego intenso; reservar o Kimi K2.7 Code para tarefas de código à escala de repositório dedicadas, onde a sua otimização de código de contexto longo justifica o seu prémio.
Como invocar os quatro (código real e executável)
A MeshTok expõe um único endpoint compatível com OpenAI em https://meshtok.com/v1. Alternar entre qualquer modelo deste artigo é uma alteração de uma linha no campo model — mesmo SDK, mesma chave de API, mesmo formato de pedido. Os IDs de modelo abaixo são os reais do catálogo.
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str) -> str:
"""Same call, different model — switch with one string."""
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": prompt}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
cheap_multimodal = ask("deepseek/deepseek-v4-pro", "Summarize this 200K-token transcript and extract action items.")
long_output = ask("bigmodel/glm-5.2", "Rewrite this 50K-token file with the new API and keep it under 100K tokens.")
balanced_vision = ask("ali/qwen3.7-max", "Describe this screenshot and suggest UI fixes.")
repo_code = ask("moonshot/kimi-k2.7-code", "Analyze this entire repository and list dead code.")
Para respostas em streaming, passe stream=True e itere os fragmentos; para chamada de ferramentas, passe o argumento tools; para saída estruturada, use response_format={"type": "json_object"}. Todos os quatro modelos suportam tools e json, pelo que o formato de pedido é idêntico entre eles. Consulte a documentação de streaming da MeshTok e a documentação de chamada de ferramentas para exemplos completos em Python, JavaScript e cURL.
FAQ
Qual dos quatro é o mais barato? O DeepSeek V4 Pro, por uma larga margem. A $0,4286/$0,8571 por milhão de tokens, é o único modelo deste grupo abaixo de $1/M tanto na entrada como na saída. Numa unidade de 1M de entrada mais 1M de saída é 2,7–4,0× mais barato do que os outros três.
Qual tem a janela de contexto mais longa? Três dos quatro — DeepSeek V4 Pro, GLM-5.2 e Qwen3.7 Max — partilham uma janela de contexto de 1.000.000 de tokens. O Kimi K2.7 Code limita-se a 256.000 tokens. A janela de contexto é o limite superior declarado que o modelo aceita, não uma garantia de qualidade em todas as posições — teste sempre o comportamento de contexto longo nos seus próprios dados.
Qual tem a saída máxima mais longa? O GLM-5.2, exclusivamente, com 128.000 tokens. O DeepSeek V4 Pro oferece 32.768; o Qwen3.7 Max e o Kimi K2.7 Code limitam-se a 8.192. Se a sua carga de trabalho emite respostas num único turno muito longas, o GLM-5.2 é a única opção aqui que não truncará.
Quais modelos suportam visão (entrada de imagem)? Apenas o DeepSeek V4 Pro e o Qwen3.7 Max. O GLM-5.2 e o Kimi K2.7 Code são apenas de texto. Notavelmente, o GLM-5.2 é o mais caro dos quatro e, ainda assim, não tem capacidade de imagem.
Porquê não há benchmarks de latência nem de qualidade neste artigo?
Porque não executámos nenhum, e não vamos publicar números que não possamos fundamentar com registos brutos. A latência depende da hora do dia, da região, do comprimento do prompt e do estado da fila; um único valor de latência do primeiro token sem a infraestrutura de teste é marketing, não dados. Comparações de qualidade sem um conjunto de avaliação partilhado são igualmente pouco sólidas. Os dados de preços e capacidades acima são a parte que é estável e verificável. Execute a sua própria avaliação na MeshTok com temperature: 0.0 e os seus próprios prompts para o resto.
O Kimi K2.7 Code é realmente um “flagship”?
Não — não ostenta a etiqueta de capacidade flagship no catálogo, e carece da etiqueta reasoning. Está incluído aqui por ser o lançamento mais relevante da Moonshot voltado para programadores: um especialista de código de contexto longo. Escolha-o para código, não para raciocínio geral. O Kimi K2.6 de propósito geral da Moonshot ostenta reasoning, caso precise disso.
Estes preços são estáveis?
Os fornecedores de modelos atualizam os preços de lista periodicamente. As figuras aqui presentes refletem o catálogo da MeshTok em 2026-08-21. O updatedDate no topo da página indica quando o artigo foi revisto pela última vez; a fonte de verdade em direto é sempre https://meshtok.com/models.
Revisto pela última vez em 2026-08-21 pela equipa da MeshTok. Todos os preços e capacidades são retirados do catálogo de modelos em direto da MeshTok (src/data/models.ts) na data da revisão. Não foram feitas medições de latência, contagem de tokens ou qualidade para este artigo — as figuras apresentadas são projeções aritméticas dos preços de lista publicados, não benchmarks empíricos.