Il catalogo MeshTok elenca più di una dozzina di modelli con una finestra di contesto di un milione di token o più. Quasi tutti sacrificano qualcosa per arrivarci — niente vision, niente video, niente audio, un output massimo piccolo, o un tag flagship mancante. Gemini 3.1 Pro è l’eccezione: una finestra di contesto di 1.048.576 token, un output massimo di 65.536 token, input nativo image+video+audio, reasoning, tools, json e l’etichetta flagship, tutto in un singolo model id. La domanda a cui risponde questo articolo è se quella combinazione valga il prezzo di $2 / $12 per milione di token.
Questa è un’analisi di specifiche e prezzi, non un benchmark sintetico. Non abbiamo eseguito test di latenza, non abbiamo misurato il recall needle-in-a-haystack in ogni posizione del contesto e non pubblicheremo alcun numero che non possiamo supportare con il catalogo live. Ogni cifra qui sotto è aritmetica che potete riprodurre con una calcolatrice a partire da src/data/models.ts. L’obiettivo è aiutarvi a decidere se la finestra da un milione di token di Gemini 3.1 Pro meriti uno slot nel vostro livello di routing — sulla base dei dati che contano davvero per il budget: finestra di contesto, output massimo, copertura multimodale e prezzo per milione di token.
Una nota onesta prima dei numeri: il model id nel catalogo è google/gemini-3.1-pro-preview. Il suffisso -preview è nei dati sorgente e non lo nasconderemo. Trattate la scheda tecnica come accurata, ma verificate contro https://meshtok.com/v1/models prima di bloccare una decisione di routing di produzione.
Gemini 3.1 Pro: la scheda tecnica
Disponibile oggi tramite l’API unificata MeshTok su https://meshtok.com/v1 con il model id google/gemini-3.1-pro-preview.
| Campo | Valore |
|---|---|
| Vendor | Google (US) |
| Finestra di contesto | 1.048.576 token (2²⁰, poco sopra 1M) |
| Output massimo | 65.536 token |
| Prezzo input (per 1M) | $2.00 |
| Prezzo output (per 1M) | $12.00 |
| Capacità | image, video, audio, reasoning, tools, json, flagship |
| Rilasciato | 2026-06 |
| Cutoff della conoscenza | 2026-05 |
Tre cose saltano all’occhio in questa fascia:
- La più ampia finestra combinata contesto+output di qualsiasi modello multimodale nel catalogo. 1.048.576 input + 65.536 output significa che una singola chiamata può ingerire all’incirca un milione di token misti di testo, immagini, audio e video ed emettere una risposta da 65K token. Nessun altro modello in
models.tscombina contemporaneamente tutte e tre le cose: contesto 1M+, output massimo 65K+ e input image+video+audio. - Multimodale nativo completo, video e audio inclusi. Gran parte dei concorrenti 1M-context si ferma a
image(DeepSeek V4 Pro, Qwen3.7 Max, Doubao Seed 2.1 Pro) o rinuncia del tutto alla vision (GLM-5.2). Gemini 3.1 Pro è l’unico flagship 1M-context nel catalogo che accetta video e audio nativamente insieme a testo e immagini. - È etichettato
flagshipereasoning. Google applica gli stessi tag di capacità che riserva alla propria fascia di frontiera. Le varianti Gemini Flash più economiche portanofastinvece direasoningeflagship— questa è la spaccatura strutturale all’interno della famiglia.
La domanda da un milione di token: quanto costa davvero 1M di contesto?
Questa è la parte che quasi tutte le pagine di marketing saltano. Una finestra di contesto da un milione di token è un budget, non un omaggio. Ogni token che inserite viene fatturato alla tariffa di input. Il modo onesto di confrontare modelli long-context è calcolare il costo di utilizzo effettivo della finestra.
Costo di una chiamata fully-loaded (1M input + un riassunto breve)
Un carico di lavoro long-context comune: inviare ~1M di token di documenti e chiedere un riassunto breve o qualche action item. Assumiamo 1.048.576 token di input e 1.000 token di output.
| Modello | Costo input | Costo output | Totale per chiamata |
|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | $0.012 | $2.109 |
| Gemini 2.5 Pro | $1.311 | $0.010 | $1.321 |
| Gemini 3 Flash | $0.524 | $0.003 | $0.527 |
| DeepSeek V4 Pro | $0.449 | $0.001 | $0.450 |
| GLM-5.2 | $1.143 | $0.004 | $1.147 |
| Claude Sonnet 5 | $3.000 | $0.015 | $3.015 |
Una singola chiamata fully-loaded di Gemini 3.1 Pro costa circa $2.11. Eseguetela mille volte al giorno e state spendendo $2.109/giorno — circa $63K/mese — solo in token di input. Non è un motivo per evitare il modello; è un motivo per essere deliberati su quando vi serve davvero la finestra completa.
Costo di una chiamata long-output fully-loaded (1M input + output massimo completo)
Dove il prezzo di Gemini 3.1 Pro diventa strutturalmente diverso è quando usate anche l’ampio output massimo. Qui assumiamo che il contesto sia riempito fino all’orlo e che al modello sia consentito emettere il suo output massimo completo.
| Modello | 1M input | Output massimo usato | Costo output | Totale per chiamata |
|---|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | 65.536 | $0.786 | $2.883 |
| GLM-5.2 | $1.143 | 128.000 | $0.512 | $1.655 |
| DeepSeek V4 Pro | $0.449 | 32.768 | $0.028 | $0.477 |
| Claude Sonnet 5 | $3.000 | 16.384 | $0.246 | $3.246 |
GLM-5.2 è più economico per chiamata fully-loaded perché il suo output massimo è 128K ma ha un prezzo di $4/1M, non $12/1M. Il fattore decisivo tra Gemini 3.1 Pro e GLM-5.2 non è il prezzo — è se vi serve input video e audio, che GLM-5.2 non accetta affatto.
Costo di 1 milione di chiamate chat brevi (1K input + 500 output ciascuna)
Per un sanity check all’altra estremità dello spettro: un milione di chiamate brevi, ciascuna con 1.000 token di input e 500 token di output. In totale fa 1 miliardo di token di input e 500 milioni di token di output.
| Modello | Costo input (1M in) | Costo output (500M out) | Totale per 1M chiamate |
|---|---|---|---|
| Gemini 3.1 Pro | $2.000 | $6.000 | $8.000 |
| Gemini 2.5 Pro | $1.250 | $5.000 | $6.250 |
| Gemini 3 Flash | $500 | $1.500 | $2.000 |
| DeepSeek V4 Pro | $429 | $429 | $857 |
| GLM-5.2 | $1.143 | $2.000 | $3.143 |
| Claude Sonnet 5 | $3.000 | $7.500 | $10.500 |
Sul traffico chat breve, Gemini 3.1 Pro costa circa 9.3× in più di DeepSeek V4 Pro e 2.5× in più di GLM-5.2. La lezione è semplice: la finestra da un milione di token è una funzionalità premium e non dovreste pagarla su traffico che non la usa mai.
Dentro la famiglia Gemini: quale scegliere?
Il catalogo MeshTok porta sette modelli Gemini con una finestra di contesto di classe 1M. Scegliere quello giusto è soprattutto un compromesso tra profondità di reasoning, copertura multimodale e prezzo.
| Modello | Contesto | Max out | Input $/M | Output $/M | Video | Audio | Reasoning | Flagship |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1.048.576 | 65.536 | $2.00 | $12.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 2.5 Pro | 1.048.576 | — | $1.25 | $10.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 3.5 Flash | 1.048.576 | 65.536 | $1.50 | $9.00 | ✅ | ✅ | — | — |
| Gemini 3 Flash | 1.048.576 | 65.536 | $0.50 | $3.00 | ✅ | ✅ | — | — |
| Gemini 3.1 Flash Lite | 1.048.576 | — | $0.25 | $1.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash | 1.048.576 | — | $0.30 | $2.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash Lite | 1.000.000 | — | $0.10 | $0.40 | ✅ | ✅ | — | — |
Lettura della matrice:
- Gemini 3.1 Pro vs Gemini 2.5 Pro — 2.5 Pro è il flagship più vecchio ed è più economico su entrambi gli assi ($1.25/$10 contro $2/$12). Le ragioni per pagare di più per 3.1 Pro: un output massimo definito di 65.536 (la voce di 2.5 Pro non ha un
maxOutputesplicito nel catalogo), un cutoff della conoscenza più recente (2026-05) e la più nuova generazione 3.1. Le ragioni per restare su 2.5 Pro: se non vi servono queste cose, è strettamente più economico. - Gemini 3.1 Pro vs Gemini 3 Flash — Flash costa un quarto e condivide lo stesso contesto 1M, lo stesso output massimo 65K e lo stesso input multimodale completo. Cosa cedete è
reasoningeflagship. Per classificazione multimodale ad alto volume, trascrizione o routing dove il ragionamento passo-passo non serve, Flash è la scelta giusta. Per tutto ciò che beneficia di catene di reasoning — analisi multi-step, Q&A su documenti lunghi con sintesi — 3.1 Pro è l’upgrade. - Gemini 3.1 Pro vs Gemini 3.1 Flash Lite / 2.5 Flash Lite — le varianti Lite sono la fascia budget. Mantengono il contesto 1M e l’input multimodale ma rinunciano al reasoning e al limite esplicito di output massimo. Usatele quando dovete ingerire molti token a basso costo e l’asticella di qualità della risposta è moderata.
Gemini 3.1 Pro rispetto agli altri flagship 1M-context
Come se la cava Gemini 3.1 Pro contro i flagship 1M-context più noti di altri lab?
| Modello | Contesto | Max out | Input $/M | Output $/M | Video | Audio | Rilasciato |
|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1.048.576 | 65.536 | $2.00 | $12.00 | ✅ | ✅ | 2026-06 |
| DeepSeek V4 Pro | 1.000.000 | 32.768 | $0.4286 | $0.8571 | — | — | 2026-04 |
| GLM-5.2 | 1.000.000 | 128.000 | $1.1429 | $4.0000 | — | — | 2026-07 |
| Qwen3.7 Max | 1.000.000 | 8.192 | $0.8571 | $2.5714 | — | — | 2026-06 |
| Claude Sonnet 5 | 1.000.000 | 16.384 | $3.0000 | $15.0000 | — | — | 2026-05 |
| Claude Opus 4.8 | 1.000.000 | 32.000 | $5.0000 | $25.0000 | — | — | 2026-06 |
Due osservazioni strutturali:
- Gemini 3.1 Pro è l’unico modello in questa tabella con input video e audio nativo. Ogni altro flagship 1M-context accetta al massimo immagini. Se il vostro carico di lavoro è comprensione di video, trascrizione di meeting o qualsiasi pipeline che ingerisce audio/video insieme al testo, Gemini 3.1 Pro non è l’opzione più economica — è l’unica opzione nella fascia 1M-context.
- GLM-5.2 ha l’output massimo più grande (128K) ma niente multimodale. Se il vostro carico di lavoro deve generare risposte di testo single-turn molto lunghe da input solo-testo, GLM-5.2 è sia più economico sia ha una finestra di output più lunga. Nel momento in cui vi serve un’immagine, un video o un audio, GLM-5.2 esce dal tavolo e Gemini 3.1 Pro rientra nella conversazione.
Il compromesso long-context vs RAG (la risposta onesta)
La domanda “la finestra da un milione di token vale davvero?” si riduce quasi sempre a una questione di costo, non di capacità. Un contesto 1M vi lascia saltare una pipeline di retrieval e buttare tutto nel prompt. È comodo, ma a $2/1M di input è anche costoso su ogni singola chiamata — e lo pagate di nuovo alla chiamata successiva, perché la finestra di contesto non si cachea gratis.
Una regola pratica semplice, derivata puramente dai prezzi qui sopra:
- Se lo stesso grande corpus viene interrogato molte volte, il retrieval è più economico. Inviate 5K token recuperati a $2/1M = $0,01 per chiamata invece di 1M di token a $2/1M = $2,00 per chiamata. Andate in pareggio dopo circa 200 chiamate solo-retrieval per ogni chiamata full-context.
- Se il corpus viene interrogato una o due volte e poi scartato (sintesi one-shot di una trascrizione fresca, una lettura approfondita di un contratto, esplorazione ad-hoc di un codebase), il long context è lo strumento giusto. Il sistema di retrieval costerebbe di più da costruire rispetto ai token che risparmia.
- Se vi serve comprensione di audio o video su una lunga timeline (una registrazione di meeting di 2 ore, un video lungo), Gemini 3.1 Pro è l’unico modello nel catalogo che combina quella modalità di input con una finestra 1M. Non c’è un sostituto più economico dentro la fascia 1M — il compromesso è tra Gemini 3.1 Pro e un modello a contesto più corto più chunking.
Quando scegliere Gemini 3.1 Pro (e quando no)
Non esiste un “miglior modello” — solo il modello giusto per un dato carico di lavoro e budget. Usate questa matrice come punto di partenza e validatela con le vostre eval.
| Carico di lavoro | Consigliato | Perché |
|---|---|---|
| Comprensione di video o audio lunghi (1M+ token di media) | Gemini 3.1 Pro | Unico modello 1M-context nel catalogo con input video e audio nativo. Nessun sostituto più economico in questa fascia. |
| Analisi long-context multimodale mista (testo + immagini + audio) | Gemini 3.1 Pro | Unico flagship che combina contesto 1M, output massimo 65K e input multimodale completo. |
| Long-context solo-testo con output molto lungo (>65K, fino a 128K) | GLM-5.2 | L’output massimo 128K di GLM-5.2 è unico. Più economico su chiamate long-output fully-loaded. Niente vision. |
| Multimodale 1M-context ad alto volume con budget limitato | Gemini 3 Flash | Un quarto del prezzo di 3.1 Pro, stesso contesto 1M, stesso input multimodale. Rinuncia al reasoning. |
| Il contesto 1M più economico possibile (testo o immagine) | DeepSeek V4 Pro | $0.43/1M di input — 4.7× più economico di Gemini 3.1 Pro sull’input. Niente video/audio. |
| Qualità di coding di vertice, costo secondario | Claude Sonnet 5 | Il posizionamento di Anthropic e le eval della community mettono Sonnet 5 in cima per il codice. Gemini 3.1 Pro se il long context multimodale conta di più. |
| Reasoning analitico long-context dove il multimodale non serve | GLM-5.2 o DeepSeek V4 Pro | Entrambi più economici per lavoro long-context solo-testo. Scegliete GLM-5.2 per output lungo, V4 Pro per il costo più basso. |
Una politica di routing predefinita ragionevole: instradate ogni chiamata che contiene video o audio a Gemini 3.1 Pro; instradate i refactor solo-testo lunghi con output molto lungo a GLM-5.2; instradate il traffico economico ad alto volume testo+immagine a DeepSeek V4 Pro; riservate Claude Sonnet 5 per il coding ad alto rischio. Gemini 3.1 Pro è lo specialista long-context multimodale, non il default per tutto.
Come chiamare Gemini 3.1 Pro (codice reale, eseguibile)
MeshTok espone un singolo endpoint compatibile con OpenAI su https://meshtok.com/v1. Passare da Gemini 3.1 Pro a qualsiasi altro modello in questo articolo è una modifica di una riga al campo model — stessa SDK, stessa API key, stesso formato di richiesta. L’esempio qui sotto mostra il pattern multimodale long-context: un prompt di testo lungo più un URL di immagine, inviato come una singola chiamata.
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
"""Same call, different model and modality — switch with one string."""
content = [{"type": "text", "text": prompt}]
if image_url:
content.append({"type": "image_url", "image_url": {"url": image_url}})
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": content}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
multimodal_long = ask("google/gemini-3.1-pro-preview",
"Summarize this 800K-token transcript and extract action items.",
image_url="https://example.com/chart.png")
text_only_long = ask("bigmodel/glm-5.2",
"Rewrite this 50K-token file with the new API.")
cheap_long = ask("deepseek/deepseek-v4-pro",
"Summarize this 200K-token document.")
coding_flagship = ask("anthropic/claude-sonnet-5",
"Refactor this Python function and add tests.")
Streaming, tool calling, JSON mode e input di immagini funzionano tutti allo stesso modo — cambiate la stringa model e aggiungete i parametri rilevanti. Per risposte in streaming, passate stream=True; per il tool calling, passate l’argomento tools; per output strutturato, usate response_format={"type": "json_object"}. Vedete i documenti sullo streaming di MeshTok e i documenti sul tool-calling per esempi completi in Python, JavaScript e cURL.
FAQ
Gemini 3.1 Pro è davvero l’unico modello 1M-context con input video e audio?
Al 2026-07-21, sì. Ogni altro modello in src/data/models.ts con una finestra di contesto 1M+ — DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.2, Qwen3.7 Max/Plus, Qwen3.5 Plus/Flash, Qwen3.6 Plus, Claude Sonnet 5, Claude Opus 4.6/4.7/4.8, MiniMax M3, Longcat 2.0, Mimo V2 Pro/V2.5 — accetta solo testo oppure testo più immagini. Nessuno porta il tag di capacità video o audio. Gli unici modelli con input video/audio nativo sono la famiglia Gemini stessa.
Perché niente benchmark di latenza o recall in questo articolo? Perché non ne abbiamo eseguito nessuno e non pubblicheremo numeri che non possiamo supportare con log grezzi. Il recall long-context (la domanda “ago nel pagliaio”) dipende dalla forma del prompt, dalla posizione, dalla lingua e dal comportamento di attention del modello a ogni profondità — una singola percentuale di recall senza il test harness, i prompt e gli output grezzi è marketing, non dati. Se vi servono numeri di recall per il vostro carico di lavoro, eseguiteli voi stessi su MeshTok con il vostro corpus. I dati di prezzo e capacità qui sopra sono la parte stabile e verificabile.
Il suffisso -preview nel model id è un problema?
È un segnale, non un blocco. Google pubblica 3.1 Pro come modello preview nel catalogo (google/gemini-3.1-pro-preview). Di solito significa che la scheda tecnica è accurata ma che il modello può cambiare comportamento senza un version bump. Per routing di produzione dove la stabilità conta più dell’ultima capacità, Gemini 2.5 Pro è l’alternativa flagship non-preview a un prezzo più basso.
Come si compara Gemini 3.1 Pro con Gemini 2.5 Pro?
2.5 Pro è il flagship Google più vecchio. È più economico ($1.25/$10 contro $2/$12), porta gli stessi tag flagship + reasoning + multimodale completo e ha la stessa finestra di contesto di 1.048.576. Le ragioni per pagare di più per 3.1 Pro: un output massimo definito di 65.536, un cutoff della conoscenza più recente (2026-05) e la più nuova generazione 3.1. Le ragioni per restare su 2.5 Pro: è strettamente più economico se non vi servono quelle tre cose.
Gemini 3.1 Pro supporta il tool calling e gli output strutturati?
Sì. Il campo capabilities elenca tools e json, il che significa che il function calling nativo e l’output strutturato in JSON-mode sono entrambi supportati tramite l’endpoint compatibile OpenAI di MeshTok. Il formato della richiesta è identico a quello di OpenAI — cambia solo il campo model.
La finestra di contesto 1M è reale o marketing?
È la finestra di contesto dichiarata in src/data/models.ts, rispecchiata dalla model card di Google stesso. Il contesto effettivamente utilizzabile dipende dalla forma del prompt, dalla strategia di retrieval e da come il modello gestisce l’attention long-context — tutte cose che dovreste testare sui vostri dati. La cifra del catalogo è il limite superiore che il modello accetta, non una garanzia di qualità in ogni posizione.
Perché Gemini 3.1 Pro è molto più caro di DeepSeek V4 Pro? Strutture di costo e capacità diverse. DeepSeek V4 Pro ha un prezzo aggressivo per il volume testo+immagine e non accetta video o audio. Gemini 3.1 Pro è prezzato come un flagship multimodale completo con supporto video e audio nativo — quella è una superficie di input diversa, non un confronto testo like-for-like. MeshTok non aggiunge alcun markup; vedete esattamente ciò che ogni lab pubblica.
Questi prezzi sono stabili?
I vendor dei modelli aggiornano i listini periodicamente. Le cifre in questo articolo riflettono il catalogo MeshTok al 2026-07-21. L’updatedDate in cima alla pagina vi dice quando l’articolo è stato revisionato l’ultima volta; la fonte di verità live è sempre https://meshtok.com/models.
Ultima revisione 2026-07-21 a cura del MeshTok Team. Tutti i prezzi e le capacità sono tratti dal catalogo modelli live di MeshTok (src/data/models.ts) alla data di revisione. Non sono state effettuate misurazioni di latenza, token-count, recall o qualità per questo articolo — le cifre mostrate sono proiezioni aritmetiche dai listini pubblicati, non benchmark empirici.