Le catalogue MeshTok liste plus d’une douzaine de modèles avec une fenêtre de contexte d’un million de tokens ou plus. Presque tous sacrifient quelque chose pour y parvenir — pas de vision, pas de vidéo, pas d’audio, une sortie max réduite, ou l’absence du tag flagship. Gemini 3.1 Pro fait figure d’exception : une fenêtre de contexte de 1 048 576 tokens, une sortie max de 65 536 tokens, des entrées natives image+vidéo+audio, reasoning, tools, json, et le label flagship, le tout dans un seul identifiant de modèle. La question à laquelle cet article répond est de savoir si cette combinaison vaut le prix de 2 $ / 12 $ par million de tokens.
Il s’agit d’une analyse spec-and-pricing, pas d’un benchmark synthétique. Nous n’avons pas lancé de tests de latence, n’avons pas mesuré le rappel « needle in a haystack » à chaque position du contexte, et ne publierons aucun chiffre que nous ne pouvons pas justifier par le catalogue en direct. Chaque valeur ci-dessous est une arithmétique que vous pouvez reproduire avec une calculatrice à partir de src/data/models.ts. L’objectif est de vous aider à décider si la fenêtre d’un million de tokens de Gemini 3.1 Pro mérite une place dans votre couche de routage — à partir des données qui comptent vraiment pour le budget : fenêtre de contexte, sortie max, couverture multimodale, et prix par million de tokens.
Une note honnête avant les chiffres : l’identifiant du modèle dans le catalogue est google/gemini-3.1-pro-preview. Le suffixe -preview est dans les données sources et nous ne le cacherons pas. Traitez la fiche technique comme exacte, mais vérifiez sur https://meshtok.com/v1/models avant de verrouiller une décision de routage en production.
Gemini 3.1 Pro : la fiche technique
Disponible dès aujourd’hui via l’API unifiée MeshTok sur https://meshtok.com/v1 sous l’identifiant google/gemini-3.1-pro-preview.
| Champ | Valeur |
|---|---|
| Éditeur | Google (États-Unis) |
| Fenêtre de contexte | 1 048 576 tokens (2²⁰, légèrement au-dessus d’1 M) |
| Sortie max | 65 536 tokens |
| Prix d’entrée (par 1 M) | 2,00 $ |
| Prix de sortie (par 1 M) | 12,00 $ |
| Capacités | image, video, audio, reasoning, tools, json, flagship |
| Publié | 2026-06 |
| Coupure de connaissances | 2026-05 |
Trois choses ressortent à ce niveau :
- La plus grande fenêtre contexte+sortie combinée de tous les modèles multimodaux du catalogue. 1 048 576 tokens d’entrée + 65 536 tokens de sortie signifient qu’un seul appel peut ingérer environ un million de tokens mêlant texte, images, audio et vidéo, et émettre une réponse de 65 K tokens. Aucun autre modèle dans
models.tsne réunit à la fois ces trois critères : contexte 1 M+, sortie max 65 K+, et entrée image+vidéo+audio. - Multimodal natif complet, vidéo et audio inclus. La plupart des concurrents à 1 M de contexte s’arrêtent à
image(DeepSeek V4 Pro, Qwen3.7 Max, Doubao Seed 2.1 Pro) ou abandonnent complètement la vision (GLM-5.2). Gemini 3.1 Pro est le seul flagship à 1 M de contexte du catalogue qui accepte nativement la vidéo et l’audio à côté du texte et des images. - Il est labellisé
flagshipetreasoning. Google applique les mêmes tags de capacité que ceux réservés à sa gamme frontière. Les variantes Gemini Flash moins chères portentfastau lieu dereasoningetflagship— c’est la fracture structurelle interne à la famille.
La question du million de tokens : que coûte réellement un contexte d’1 M ?
C’est la partie que la plupart des pages marketing esquivent. Une fenêtre de contexte d’un million de tokens est un budget, pas un cadeau. Chaque token que vous mettez dedans est facturé au tarif d’entrée. La manière honnête de comparer les modèles à contexte long est de calculer le coût d’une utilisation réelle de la fenêtre.
Coût d’un appel plein (1 M entrée + un résumé court)
Une charge de travail classique en contexte long : envoyer ~1 M tokens de documents et demander un bref résumé ou quelques actions. Nous supposons 1 048 576 tokens d’entrée et 1 000 tokens de sortie.
| Modèle | Coût d’entrée | Coût de sortie | Total par appel |
|---|---|---|---|
| Gemini 3.1 Pro | 2,097 $ | 0,012 $ | 2,109 $ |
| Gemini 2.5 Pro | 1,311 $ | 0,010 $ | 1,321 $ |
| Gemini 3 Flash | 0,524 $ | 0,003 $ | 0,527 $ |
| DeepSeek V4 Pro | 0,449 $ | 0,001 $ | 0,450 $ |
| GLM-5.2 | 1,143 $ | 0,004 $ | 1,147 $ |
| Claude Sonnet 5 | 3,000 $ | 0,015 $ | 3,015 $ |
Un seul appel Gemini 3.1 Pro chargé à plein coûte environ 2,11 $. Répétez cela mille fois par jour et vous dépensez 2 109 $/jour — environ 63 K $/mois — en tokens d’entrée uniquement. Ce n’est pas une raison pour éviter le modèle ; c’est une raison pour être délibéré sur le moment où vous avez réellement besoin de la fenêtre complète.
Coût d’un appel à sortie longue (1 M entrée + sortie max pleine)
Là où la tarification de Gemini 3.1 Pro devient structurellement différente, c’est quand vous utilisez aussi la large sortie max. Ici, nous supposons que le contexte est rempli à ras bord et que le modèle peut émettre sa sortie max complète.
| Modèle | Entrée 1 M | Sortie max utilisée | Coût de sortie | Total par appel |
|---|---|---|---|---|
| Gemini 3.1 Pro | 2,097 $ | 65 536 | 0,786 $ | 2,883 $ |
| GLM-5.2 | 1,143 $ | 128 000 | 0,512 $ | 1,655 $ |
| DeepSeek V4 Pro | 0,449 $ | 32 768 | 0,028 $ | 0,477 $ |
| Claude Sonnet 5 | 3,000 $ | 16 384 | 0,246 $ | 3,246 $ |
GLM-5.2 est moins cher par appel plein parce que sa sortie max est de 128 K mais facturée à 4 $/1 M, pas 12 $/1 M. Le facteur décisif entre Gemini 3.1 Pro et GLM-5.2 n’est pas le prix — c’est de savoir si vous avez besoin de l’entrée vidéo et audio, que GLM-5.2 n’accepte pas du tout.
Coût d’un million d’appels courts en chat (1 K entrée + 500 sortie chacun)
Pour un contrôle de cohérence à l’autre bout du spectre : un million d’appels courts, chacun consommant 1 000 tokens d’entrée et produisant 500 tokens de sortie. Cela fait 1 milliard de tokens d’entrée et 500 millions de tokens de sortie au total.
| Modèle | Coût d’entrée (1 Md in) | Coût de sortie (500 M out) | Total pour 1 M d’appels |
|---|---|---|---|
| Gemini 3.1 Pro | 2 000 $ | 6 000 $ | 8 000 $ |
| Gemini 2.5 Pro | 1 250 $ | 5 000 $ | 6 250 $ |
| Gemini 3 Flash | 500 $ | 1 500 $ | 2 000 $ |
| DeepSeek V4 Pro | 429 $ | 429 $ | 857 $ |
| GLM-5.2 | 1 143 $ | 2 000 $ | 3 143 $ |
| Claude Sonnet 5 | 3 000 $ | 7 500 $ | 10 500 $ |
Sur du trafic de chat court, Gemini 3.1 Pro est environ 9,3× plus cher que DeepSeek V4 Pro et 2,5× plus cher que GLM-5.2. La leçon est simple : la fenêtre d’un million de tokens est une fonctionnalité premium, et vous ne devriez pas la payer sur du trafic qui ne l’utilise jamais.
Au sein de la famille Gemini : lequel choisir ?
Le catalogue MeshTok propose sept modèles Gemini avec une fenêtre de contexte de classe 1 M. Choisir le bon est surtout un compromis entre profondeur de raisonnement, couverture multimodale, et prix.
| Modèle | Contexte | Sortie max | Entrée $/M | Sortie $/M | Vidéo | Audio | Raisonnement | Flagship |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1 048 576 | 65 536 | 2,00 $ | 12,00 $ | ✅ | ✅ | ✅ | ✅ |
| Gemini 2.5 Pro | 1 048 576 | — | 1,25 $ | 10,00 $ | ✅ | ✅ | ✅ | ✅ |
| Gemini 3.5 Flash | 1 048 576 | 65 536 | 1,50 $ | 9,00 $ | ✅ | ✅ | — | — |
| Gemini 3 Flash | 1 048 576 | 65 536 | 0,50 $ | 3,00 $ | ✅ | ✅ | — | — |
| Gemini 3.1 Flash Lite | 1 048 576 | — | 0,25 $ | 1,50 $ | ✅ | ✅ | — | — |
| Gemini 2.5 Flash | 1 048 576 | — | 0,30 $ | 2,50 $ | ✅ | ✅ | — | — |
| Gemini 2.5 Flash Lite | 1 000 000 | — | 0,10 $ | 0,40 $ | ✅ | ✅ | — | — |
Lecture de la matrice :
- Gemini 3.1 Pro vs Gemini 2.5 Pro — 2.5 Pro est le flagship plus ancien et il est moins cher sur les deux axes (1,25 $/10 $ vs 2 $/12 $). L’argument pour payer plus cher pour 3.1 Pro : une sortie max définie à 65 536 (l’entrée 2.5 Pro n’a pas de
maxOutputexplicite dans le catalogue), une coupure de connaissances plus récente (2026-05), et la génération 3.1 plus récente. L’argument pour rester sur 2.5 Pro : si vous n’en avez pas besoin, il est strictement moins cher. - Gemini 3.1 Pro vs Gemini 3 Flash — Flash coûte un quart du prix et partage le même contexte 1 M, la même sortie max 65 K et la même entrée multimodale complète. Ce que vous abandonnez, c’est
reasoningetflagship. Pour la classification multimodale à haut volume, la transcription ou le routage où la pensée pas-à-pas n’est pas nécessaire, Flash est le bon choix. Pour tout ce qui bénéficie de chaînes de raisonnement — analyses multi-étapes, Q&A sur longs documents avec synthèse — 3.1 Pro est la mise à niveau. - Gemini 3.1 Pro vs Gemini 3.1 Flash Lite / 2.5 Flash Lite — les variantes Lite sont l’extrémité économique. Elles conservent le contexte 1 M et l’entrée multimodale mais abandonnent le raisonnement et le plafond de sortie max explicite. Utilisez-les quand vous devez ingérer beaucoup de tokens à bas coût et que le niveau de qualité attendu de la réponse est modéré.
Gemini 3.1 Pro vs les autres flagships à 1 M de contexte
Comment Gemini 3.1 Pro se compare-t-il aux flagships à contexte 1 M plus connus d’autres laboratoires ?
| Modèle | Contexte | Sortie max | Entrée $/M | Sortie $/M | Vidéo | Audio | Publié |
|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1 048 576 | 65 536 | 2,00 $ | 12,00 $ | ✅ | ✅ | 2026-06 |
| DeepSeek V4 Pro | 1 000 000 | 32 768 | 0,4286 $ | 0,8571 $ | — | — | 2026-04 |
| GLM-5.2 | 1 000 000 | 128 000 | 1,1429 $ | 4,0000 $ | — | — | 2026-07 |
| Qwen3.7 Max | 1 000 000 | 8 192 | 0,8571 $ | 2,5714 $ | — | — | 2026-06 |
| Claude Sonnet 5 | 1 000 000 | 16 384 | 3,0000 $ | 15,0000 $ | — | — | 2026-05 |
| Claude Opus 4.8 | 1 000 000 | 32 000 | 5,0000 $ | 25,0000 $ | — | — | 2026-06 |
Deux observations structurelles :
- Gemini 3.1 Pro est le seul modèle de ce tableau avec entrée vidéo et audio native. Tous les autres flagships à contexte 1 M acceptent au maximum des images. Si votre charge de travail est la compréhension vidéo, la transcription de réunions ou tout pipeline qui ingère audio/vidéo à côté du texte, Gemini 3.1 Pro n’est pas l’option la moins chère — c’est la seule option de la catégorie à 1 M de contexte.
- GLM-5.2 a la plus grande sortie max (128 K) mais aucune multimodalité. Si votre charge de travail doit produire des réponses texte très longues en un seul tour à partir d’une entrée texte uniquement, GLM-5.2 est à la fois moins cher et dispose d’une fenêtre de sortie plus longue. Dès que vous avez besoin d’une image, d’une vidéo ou d’un audio, GLM-5.2 est hors jeu et Gemini 3.1 Pro revient dans la conversation.
Le compromis contexte long vs RAG (la réponse honnête)
La question « la fenêtre d’un million de tokens vaut-elle le coup ? » se réduit presque toujours à une question de coût, pas de capacité. Un contexte d’1 M vous permet de sauter un pipeline de retrieval et de tout balancer dans le prompt. C’est pratique, mais à 2 $/1 M en entrée c’est aussi coûteux à chaque appel — et vous le payez à nouveau au prochain appel, parce que la fenêtre de contexte n’est pas mise en cache gratuitement.
Une règle empirique simple, dérivée uniquement de la tarification ci-dessus :
- Si le même corpus volumineux est interrogé plusieurs fois, le retrieval est moins cher. Envoyez 5 K tokens retrieved à 2 $/1 M = 0,01 $ par appel au lieu de 1 M tokens à 2 $/1 M = 2,00 $ par appel. Vous atteignez l’équilibre après environ 200 appels en retrieval seul pour chaque appel à contexte complet.
- Si le corpus est interrogé une ou deux fois puis abandonné (résumé one-shot d’un transcript frais, une lecture approfondie d’un contrat, exploration ad hoc d’une codebase), le contexte long est l’outil adapté. Le système de retrieval coûterait plus cher à construire qu’il n’épargne de tokens.
- Si vous avez besoin de compréhension audio ou vidéo sur une longue durée (un enregistrement de réunion de 2 heures, une vidéo longue), Gemini 3.1 Pro est le seul modèle du catalogue qui combine cette modalité d’entrée avec une fenêtre d’1 M. Il n’existe pas de substitut moins cher dans la catégorie 1 M — le compromis se fait entre Gemini 3.1 Pro et un modèle à contexte plus court plus du découpage.
Quand choisir Gemini 3.1 Pro (et quand ne pas le faire)
Il n’y a pas de « meilleur modèle » — seulement le bon modèle pour une charge de travail et un budget donnés. Utilisez cette matrice comme point de départ et validez avec votre propre évaluation.
| Charge de travail | Recommandé | Pourquoi |
|---|---|---|
| Compréhension longue vidéo ou audio (1 M+ tokens de média) | Gemini 3.1 Pro | Seul modèle à 1 M de contexte du catalogue avec entrée native video et audio. Pas de substitut moins cher dans cette catégorie. |
| Analyse longue contexte multimodale mixte (texte + images + audio) | Gemini 3.1 Pro | Seul flagship combinant contexte 1 M, sortie max 65 K et entrée multimodale complète. |
| Contexte long texte uniquement avec sortie très longue (>65 K, jusqu’à 128 K) | GLM-5.2 | La sortie max de 128 K de GLM-5.2 est unique. Moins cher sur les appels longs à sortie pleine chargés. Pas de vision. |
| Trafic 1 M multimodal haut volume à petit budget | Gemini 3 Flash | Un quart du prix de 3.1 Pro, même contexte 1 M, même entrée multimodale. Abandonne le raisonnement. |
| Contexte 1 M le moins cher possible (texte ou image) | DeepSeek V4 Pro | 0,43 $/1 M en entrée — 4,7× moins cher que Gemini 3.1 Pro en entrée. Pas de vidéo/audio. |
| Qualité de code haut de gamme, coût secondaire | Claude Sonnet 5 | Le positionnement d’Anthropic et les évals communautaires placent Sonnet 5 au sommet pour le code. Gemini 3.1 Pro si le contexte long multimodal compte davantage. |
| Raisonnement analytique à contexte long sans multimodalité nécessaire | GLM-5.2 ou DeepSeek V4 Pro | Tous deux moins chers pour le travail long contexte texte uniquement. Choisissez GLM-5.2 pour une sortie longue, V4 Pro pour le coût le plus bas. |
Une politique de routage par défaut raisonnable : routez tout appel contenant de la vidéo ou de l’audio vers Gemini 3.1 Pro ; routez les refactorisations long texte avec sortie très longue vers GLM-5.2 ; routez le trafic texte+image haut volume et bon marché vers DeepSeek V4 Pro ; réservez Claude Sonnet 5 au code à enjeux élevés. Gemini 3.1 Pro est le spécialiste du contexte long multimodal, pas le défaut pour tout.
Comment appeler Gemini 3.1 Pro (du code réel, exécutable)
MeshTok expose un endpoint unique compatible OpenAI sur https://meshtok.com/v1. Passer de Gemini 3.1 Pro à n’importe quel autre modèle de cet article se résume à modifier une ligne du champ model — même SDK, même clé d’API, même format de requête. L’exemple ci-dessous montre le motif long contexte multimodal : un prompt texte long plus une URL d’image, envoyés en un seul appel.
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
"""Same call, different model and modality — switch with one string."""
content = [{"type": "text", "text": prompt}]
if image_url:
content.append({"type": "image_url", "image_url": {"url": image_url}})
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": content}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
multimodal_long = ask("google/gemini-3.1-pro-preview",
"Summarize this 800K-token transcript and extract action items.",
image_url="https://example.com/chart.png")
text_only_long = ask("bigmodel/glm-5.2",
"Rewrite this 50K-token file with the new API.")
cheap_long = ask("deepseek/deepseek-v4-pro",
"Summarize this 200K-token document.")
coding_flagship = ask("anthropic/claude-sonnet-5",
"Refactor this Python function and add tests.")
Streaming, appel d’outils, mode JSON et entrée image fonctionnent tous de la même façon — changez la chaîne model et ajoutez les paramètres pertinents. Pour des réponses en streaming, passez stream=True ; pour l’appel d’outils, passez l’argument tools ; pour une sortie structurée, utilisez response_format={"type": "json_object"}. Voir la documentation streaming de MeshTok et la documentation tool-calling pour des exemples complets en Python, JavaScript et cURL.
FAQ
Gemini 3.1 Pro est-il vraiment le seul modèle à contexte 1 M avec entrée vidéo et audio ?
Au 2026-07-21, oui. Tous les autres modèles dans src/data/models.ts avec une fenêtre de contexte 1 M+ — DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.2, Qwen3.7 Max/Plus, Qwen3.5 Plus/Flash, Qwen3.6 Plus, Claude Sonnet 5, Claude Opus 4.6/4.7/4.8, MiniMax M3, Longcat 2.0, Mimo V2 Pro/V2.5 — acceptent soit texte uniquement soit texte plus images. Aucun ne porte le tag de capacité video ou audio. Les seuls modèles avec entrée vidéo/audio native sont la famille Gemini elle-même.
Pourquoi aucun benchmark de latence ou de rappel dans cet article ? Parce que nous n’en avons lancé aucun, et que nous ne publierons pas de chiffres que nous ne pouvons pas justifier par des logs bruts. Le rappel en contexte long (la question « needle in a haystack ») dépend de la forme du prompt, de la position, de la langue et du comportement d’attention du modèle à chaque profondeur — un pourcentage de rappel unique sans harnais de test, sans prompts et sans sorties brutes, c’est du marketing, pas des données. Si vous avez besoin de chiffres de rappel pour votre charge de travail, lancez-les vous-même sur MeshTok avec votre propre corpus. Les données de prix et de capacités ci-dessus sont la partie stable et vérifiable.
Le suffixe -preview dans l’identifiant du modèle est-il un problème ?
C’est un signal, pas un bloqueur. Google livre 3.1 Pro comme modèle preview dans le catalogue (google/gemini-3.1-pro-preview). Cela signifie généralement que la fiche technique est exacte mais que le modèle peut changer de comportement sans bump de version. Pour du routage de production où la stabilité compte plus que la dernière capacité, Gemini 2.5 Pro est l’alternative flagship non-preview à un prix inférieur.
Comment Gemini 3.1 Pro se compare-t-il à Gemini 2.5 Pro ?
2.5 Pro est le flagship Google plus ancien. Il est moins cher (1,25 $/10 $ vs 2 $/12 $), porte les mêmes tags flagship + reasoning + multimodal complet, et possède la même fenêtre de contexte 1 048 576. L’argument pour payer plus cher pour 3.1 Pro : une sortie max définie à 65 536, une coupure de connaissances plus récente (2026-05) et la génération 3.1 plus récente. L’argument pour rester sur 2.5 Pro : il est strictement moins cher si vous n’avez pas besoin de ces trois choses.
Gemini 3.1 Pro supporte-t-il l’appel d’outils et les sorties structurées ?
Oui. Le champ capabilities liste tools et json, ce qui signifie que l’appel de fonction natif et la sortie structurée en mode JSON sont tous deux pris en charge via le endpoint MeshTok compatible OpenAI. Le format de requête est identique à celui d’OpenAI — seul le champ model change.
La fenêtre de contexte d’1 M est-elle réelle ou marketing ?
C’est la fenêtre de contexte déclarée dans src/data/models.ts, reflétée depuis la propre fiche modèle de Google. Le contexte réellement utilisable dépend de la forme de votre prompt, de votre stratégie de retrieval et de la façon dont le modèle gère l’attention en contexte long — autant d’éléments que vous devriez tester sur vos propres données. Le chiffre du catalogue est la borne supérieure que le modèle accepte, pas une garantie de qualité à chaque position.
Pourquoi Gemini 3.1 Pro est-il tellement plus cher que DeepSeek V4 Pro ? Des structures de coût et des capacités différentes. DeepSeek V4 Pro est tarifié agressivement pour le volume texte+image et n’accepte ni vidéo ni audio. Gemini 3.1 Pro est tarifié comme un flagship multimodal complet avec support vidéo et audio natif — c’est une surface d’entrée différente, pas une comparaison texte-contre-texte équivalente. MeshTok n’ajoute aucune marge ; vous voyez exactement ce que chaque laboratoire publie.
Ces prix sont-ils stables ?
Les éditeurs de modèles mettent à jour leurs prix catalogue périodiquement. Les chiffres de cet article reflètent le catalogue MeshTok au 2026-07-21. Le champ updatedDate en haut de la page vous indique quand l’article a été révisé pour la dernière fois ; la source de vérité en direct est toujours https://meshtok.com/models.
Dernière révision le 2026-07-21 par l’équipe MeshTok. Tous les prix et capacités sont tirés du catalogue de modèles MeshTok en direct (src/data/models.ts) à la date de révision. Aucune mesure de latence, de nombre de tokens, de rappel ou de qualité n’a été effectuée pour cet article — les chiffres présentés sont des projections arithmétiques des prix catalogue publiés, pas des benchmarks empiriques.