Model Analysis gemini-3-1-progeminilong-contextmultimodalanalysis2026

Gemini 3.1 Pro ロングコンテキスト分析:100万トークンウィンドウは価値があるか?

2026年7月時点のスペック・料金分析。Gemini 3.1 Pro の 1,048,576 トークンのコンテキストウィンドウ、65K の最大出力、完全なマルチモーダル入力、そして DeepSeek V4 Pro、GLM-5.2、Claude Sonnet 5、Gemini 兄弟モデルとの実際の MeshTok 料金を比較します。捏造したベンチマークは一切ありません。

著者 MeshTok Team · 公開日 2026年7月21日 · 更新日 2026年7月21日 · 7 分で読了

MeshTok のカタログには、100万トークン以上のコンテキストウィンドウを持つモデルが十数種類登録されています。ほとんどは、100万トークンに到達するために何かを犠牲にしています ― ビジョンなし、動画なし、音声なし、最大出力が小さい、あるいは flagship タグなし、など。Gemini 3.1 Pro はその例外です。1,048,576 トークンのコンテキストウィンドウ、65,536 トークンの最大出力、ネイティブな画像+動画+音声入力、reasoningtoolsjson、そして flagship ラベルを、1つのモデル ID で全て備えています。本記事が答えるのは、その組み合わせが 100万トークンあたり $2 / $12 という料金に見合うものか、という問いです。

本記事は スペックと料金の分析 であり、合成ベンチマークではありません。レイテンシテストは行っていませんし、各コンテキスト位置での干し草の山から針を探す(needle-in-a-haystack)リコールも計測していません。実カタログで裏付けられない数字は一切掲載しません。以下に示す数字はすべて、src/data/models.ts から電卓で再現できる算術結果です。目的は、コンテキストウィンドウ、最大出力、マルチモーダル対応範囲、100万トークンあたりの価格 という予算策定で本当に重要なデータに基づいて、Gemini 3.1 Pro の100万トークンウィンドウがあなたのルーティング層に一席を与えられるかを判断する助けになることです。

数字に入る前の正直な注記:カタログ上のモデル ID は google/gemini-3.1-pro-preview です。この -preview サフィックスはソースデータに含まれているもので、隠しません。スペックシートは正確と考えてください。ただし、本番環境のルーティング判断を確定する前には https://meshtok.com/v1/models で必ず確認してください。

Gemini 3.1 Pro:スペックシート

現在、MeshTok 統合 API(https://meshtok.com/v1)でモデル ID google/gemini-3.1-pro-preview を指定することで利用可能です。

項目
ベンダーGoogle(US)
コンテキストウィンドウ1,048,576 トークン(2²⁰、1M よりやや上)
最大出力65,536 トークン
入力料金(100万トークンあたり)$2.00
出力料金(100万トークンあたり)$12.00
対応機能image, video, audio, reasoning, tools, json, flagship
リリース2026-06
ナレッジカットオフ2026-05

このクラスで際立つポイントは3つあります:

  1. カタログ内のマルチモーダルモデルの中で、コンテキストと出力を合わせたウィンドウが最大。 1,048,576 の入力 + 65,536 の出力は、1回の呼び出しでテキスト・画像・音声・動画を混ぜて約100万トークン取り込み、65K トークンの応答を返せることを意味します。models.ts の中で、1M+ コンテキスト、65K+ 最大出力、image+video+audio 入力の3つを同時に満たす他のモデルはありません。
  2. 動画と音声を含む完全なネイティブマルチモーダル。 ほとんどの 1M コンテキスト競合は image で止まります(DeepSeek V4 Pro、Qwen3.7 Max、Doubao Seed 2.1 Pro)し、ビジョン自体を持たないものもあります(GLM-5.2)。Gemini 3.1 Pro は、カタログ内で唯一、テキストと画像に加えて動画と音声をネイティブに受け付ける 1M コンテキストのフラッグシップです。
  3. flagshipreasoning のラベルが付いています。 Google は最先端ティアにのみ与える能力タグを付与しています。より安価な Gemini Flash 系には reasoningflagship の代わりに fast が付与されており、これがファミリー内の構造的な境界です。

100万トークンの問い:1M コンテキストは実際にいくらか?

ここはほとんどのマーケティングページがスキップする部分です。100万トークンのコンテキストウィンドウは予算であり、無料ではありません。入力したトークンはすべて入力単価で請求されます。ロングコンテキストモデルを正しく比較するには、実際にそのウィンドウを使った場合のコストを計算する必要があります。

1回の満載呼び出しのコスト(1M 入力 + 短い要約)

典型的なロングコンテキストワークロード:約 1M トークンの文書を送り、短い要約やいくつかのアクションアイテムを求める。ここでは入力 1,048,576 トークン、出力 1,000 トークンを仮定します。

モデル入力コスト出力コスト1呼び出しあたり合計
Gemini 3.1 Pro$2.097$0.012$2.109
Gemini 2.5 Pro$1.311$0.010$1.321
Gemini 3 Flash$0.524$0.003$0.527
DeepSeek V4 Pro$0.449$0.001$0.450
GLM-5.2$1.143$0.004$1.147
Claude Sonnet 5$3.000$0.015$3.015

1回の満載呼び出しで Gemini 3.1 Pro は約 $2.11 かかります。これを1日1000回実行すると、入力トークンだけで $2,109/日 ― ほぼ $63K/月 を費やすことになります。これはモデルを避ける理由ではなく、実際にフルウィンドウが必要になる タイミング を意識的に判断すべきという理由です。

満載ロング出力呼び出しのコスト(1M 入力 + 最大出力フル使用)

Gemini 3.1 Pro の料金が構造的に異なるのは、大きな最大出力も一緒に使う場合です。ここでは、コンテキストを限界まで詰め、モデルが最大出力をフルに出力できると仮定します。

モデル1M 入力最大出力使用量出力コスト1呼び出しあたり合計
Gemini 3.1 Pro$2.09765,536$0.786$2.883
GLM-5.2$1.143128,000$0.512$1.655
DeepSeek V4 Pro$0.44932,768$0.028$0.477
Claude Sonnet 5$3.00016,384$0.246$3.246

GLM-5.2 は、最大出力が 128K ありながら $12/1M ではなく $4/1M で料金設定されているため、満載呼び出しあたりでは安くなります。Gemini 3.1 Pro と GLM-5.2 の決め手は価格ではなく、動画と音声入力 が必要かどうかです。GLM-5.2 はこれらを一切受け付けません。

100万回の短いチャット呼び出しのコスト(各 1K 入力 + 500 出力)

スペクトルの反対側での健全性チェック:100万回の短い呼び出しで、各呼び出しが 1,000 入力トークンを消費し 500 出力トークンを生成するとします。合計で 10億入力トークン、5億出力トークンになります。

モデル入力コスト(10億 in)出力コスト(5億 out)100万呼び出しあたり合計
Gemini 3.1 Pro$2,000$6,000$8,000
Gemini 2.5 Pro$1,250$5,000$6,250
Gemini 3 Flash$500$1,500$2,000
DeepSeek V4 Pro$429$429$857
GLM-5.2$1,143$2,000$3,143
Claude Sonnet 5$3,000$7,500$10,500

短いチャットトラフィックでは、Gemini 3.1 Pro は DeepSeek V4 Pro の約 9.3倍GLM-5.2 の約 2.5倍 高くなります。教訓は単純です:100万トークンウィンドウはプレミアム機能であり、それを使わないトラフィックに対して支払うべきではありません。

Gemini ファミリー内部:どれを選ぶべきか?

MeshTok のカタログには 1M クラスのコンテキストウィンドウを持つ Gemini モデルが7つあります。適切な1つを選ぶことは、ほぼ 推論の深さ、マルチモーダル対応範囲、価格 のトレードオフになります。

モデルコンテキスト最大出力入力 $/M出力 $/M動画音声推論フラッグシップ
Gemini 3.1 Pro1,048,57665,536$2.00$12.00
Gemini 2.5 Pro1,048,576$1.25$10.00
Gemini 3.5 Flash1,048,57665,536$1.50$9.00
Gemini 3 Flash1,048,57665,536$0.50$3.00
Gemini 3.1 Flash Lite1,048,576$0.25$1.50
Gemini 2.5 Flash1,048,576$0.30$2.50
Gemini 2.5 Flash Lite1,000,000$0.10$0.40

マトリックスの読み方:

  • Gemini 3.1 Pro vs Gemini 2.5 Pro ― 2.5 Pro は旧フラッグシップで、両軸とも安価です($2/$12 に対し $1.25/$10)。3.1 Pro に高い金額を払う理由:カタログ上で明示された 65,536 の最大出力(2.5 Pro のエントリには明示的な maxOutput がありません)、より新しいナレッジカットオフ(2026-05)、そして新しい 3.1 世代。2.5 Pro に留まる理由:それらが不要なら、純粋に安く済みます。
  • Gemini 3.1 Pro vs Gemini 3 Flash ― Flash は4分の1の価格で、同じ 1M コンテキスト、65K 最大出力、完全なマルチモーダル入力を共有します。諦めるのは reasoningflagship です。ステップバイステップの推論が不要な、高ボリュームのマルチモーダル分類、文字起こし、ルーティングには Flash が適しています。推論チェーンが役立つ場面 ― 多段分析、長文書 Q&A と統合 ― では 3.1 Pro がアップグレード先になります。
  • Gemini 3.1 Pro vs Gemini 3.1 Flash Lite / 2.5 Flash Lite ― Lite 系は低価格帯です。1M コンテキストとマルチモーダル入力を維持しつつ、推論と明示的な最大出力上限を落としています。大量のトークンを安く取り込み、応答の品質要件が中程度の場合に使います。

Gemini 3.1 Pro vs 他の 1M コンテキストフラッグシップ

Gemini 3.1 Pro は、他の研究室による著名な 1M コンテキストフラッグシップと比べてどうでしょうか?

モデルコンテキスト最大出力入力 $/M出力 $/M動画音声リリース
Gemini 3.1 Pro1,048,57665,536$2.00$12.002026-06
DeepSeek V4 Pro1,000,00032,768$0.4286$0.85712026-04
GLM-5.21,000,000128,000$1.1429$4.00002026-07
Qwen3.7 Max1,000,0008,192$0.8571$2.57142026-06
Claude Sonnet 51,000,00016,384$3.0000$15.00002026-05
Claude Opus 4.81,000,00032,000$5.0000$25.00002026-06

2つの構造的な観察:

  1. Gemini 3.1 Pro は、この表の中でネイティブな動画・音声入力を持つ唯一のモデルです。 他の 1M コンテキストフラッグシップは、せいぜい画像までしか受け付けません。ワークロードが動画理解、会議の文字起こし、テキストと一緒に音声/動画を取り込むパイプラインであれば、Gemini 3.1 Pro は最も安い選択肢ではなく、1M コンテキストティアにおける唯一の選択肢です。
  2. GLM-5.2 は最大出力が最大(128K)ですが、マルチモーダルは一切ありません。 テキストのみの入力から非常に長い単発テキスト応答を生成する必要があるワークロードでは、GLM-5.2 はより安く、より長い出力ウィンドウを持ちます。画像、動画、音声が必要になった瞬間、GLM-5.2 は選択肢から外れ、Gemini 3.1 Pro が再び候補になります。

ロングコンテキスト vs RAG のトレードオフ(正直な答え)

「100万トークンウィンドウは価値があるか?」という問いは、ほぼ常に能力の問いではなくコストの問いに帰着します。1M コンテキストがあれば、検索パイプラインをスキップしてすべてをプロンプトに流し込めます。これは便利ですが、入力 $2/1M では毎回の呼び出しで高くつきます ― しかもコンテキストウィンドウは無料でキャッシュされないため、次の呼び出しでも再び支払うことになります。

純粋に上記の料金から導かれる簡単な経験則:

  • 同じ大規模コーパスを何度も照会する場合、検索の方が安いです。1M トークンを $2/1M = 1呼び出しあたり $2.00 の代わりに、5K の検索トークンを $2/1M = 1呼び出しあたり $0.01 送信できます。フルコンテキスト呼び出し1回あたり、検索のみの呼び出し約200回で損益分岐点となります。
  • コーパスを1〜2回照会して破棄する場合(新鮮なトランスクリプトのワンショット要約、契約書の1回限りの精読、コードベースのアドホックな探索)、ロングコンテキストが適切なツールです。検索システムを構築するコストの方が、節約できるトークンコストより高くなります。
  • 長期間にわたる音声や動画の理解が必要な場合(2時間の会議録音、長時間の動画)、Gemini 3.1 Pro はその入力モダリティと 1M ウィンドウを組み合わせたカタログ内唯一のモデルです。1M ティア内に安い代替品はありません ― トレードオフは Gemini 3.1 Pro と、より短いコンテキストモデル+チャンキングの間になります。

Gemini 3.1 Pro を選ぶべきとき(と選ばないとき)

「最良のモデル」は存在しません ― 与えられたワークロードと予算に対して適切なモデルがあるだけです。このマトリックスを出発点とし、独自の評価で検証してください。

ワークロード推奨理由
長時間の動画・音声理解(メディアで 1M+ トークン)Gemini 3.1 Proカタログ内でネイティブな videoaudio 入力を持つ唯一の 1M コンテキストモデル。このティアに安い代替品はありません。
混合マルチモーダル長文脈分析(テキスト+画像+音声)Gemini 3.1 Pro1M コンテキスト、65K 最大出力、完全なマルチモーダル入力を組み合わせた唯一のフラッグシップ。
非常に長い出力(>65K、最大128K)を伴うテキストのみのロングコンテキストGLM-5.2GLM-5.2 の 128K 最大出力は唯一無二。満載ロング出力呼び出しでより安価。ビジョンなし。
低予算で高ボリュームの 1M コンテキストマルチモーダルGemini 3 Flash3.1 Pro の4分の1の価格で、同じ 1M コンテキスト、同じマルチモーダル入力。推論はなし。
可能な限り安い 1M コンテキスト(テキストまたは画像)DeepSeek V4 Pro$0.43/1M 入力 ― Gemini 3.1 Pro の入力より 4.7倍 安い。動画/音声なし。
トップクラスのコード品質、コストは副次的Claude Sonnet 5Anthropic の位置づけとコミュニティ評価では、Sonnet 5 がコードでトップ。マルチモーダル長文脈がより重要なら Gemini 3.1 Pro。
マルチモーダルが不要なロングコンテキスト分析推論GLM-5.2 または DeepSeek V4 Proどちらもテキストのみのロングコンテキスト作業ではより安価。長い出力なら GLM-5.2、最低コストなら V4 Pro。

妥当なデフォルトのルーティングポリシー:動画または音声を含む呼び出しは Gemini 3.1 Pro へ、非常に長い出力を伴う長文テキストのみのリファクタリングは GLM-5.2 へ、低コスト・高ボリュームのテキスト+画像トラフィックは DeepSeek V4 Pro へ、Claude Sonnet 5 は重要度の高いコーディングに温存。Gemini 3.1 Pro はマルチモーダル長文脈のスペシャリストであり、すべてのデフォルトではありません。

Gemini 3.1 Pro の呼び出し方(実際に動くコード)

MeshTok は https://meshtok.com/v1 に OpenAI 互換の単一エンドポイントを提供しています。Gemini 3.1 Pro と本記事の他のモデルの切り替えは model フィールドの1行変更のみで済みます ― 同じ SDK、同じ API キー、同じリクエスト形式です。以下の例は、ロングコンテキストマルチモーダルのパターンを示しています:長いテキストプロンプトと画像 URL を1回の呼び出しで送信します。

# pip install openai
from openai import OpenAI

client = OpenAI(
    base_url="https://meshtok.com/v1",
    api_key="sk-your-meshtok-key",
)

def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
    """Same call, different model and modality — switch with one string."""
    content = [{"type": "text", "text": prompt}]
    if image_url:
        content.append({"type": "image_url", "image_url": {"url": image_url}})
    resp = client.chat.completions.create(
        model=model_id,
        messages=[{"role": "user", "content": content}],
    )
    return resp.choices[0].message.content

# Real model IDs from the MeshTok catalog
multimodal_long  = ask("google/gemini-3.1-pro-preview",
                       "Summarize this 800K-token transcript and extract action items.",
                       image_url="https://example.com/chart.png")
text_only_long   = ask("bigmodel/glm-5.2",
                       "Rewrite this 50K-token file with the new API.")
cheap_long       = ask("deepseek/deepseek-v4-pro",
                       "Summarize this 200K-token document.")
coding_flagship  = ask("anthropic/claude-sonnet-5",
                       "Refactor this Python function and add tests.")

ストリーミング、ツール呼び出し、JSON モード、画像入力はすべて同じように機能します ― model 文字列を変更し、関連パラメータを追加するだけです。ストリーミング応答には stream=True を渡し、ツール呼び出しには tools 引数を渡し、構造化出力には response_format={"type": "json_object"} を使用します。Python、JavaScript、cURL での完全な例は MeshTok ストリーミングドキュメントツール呼び出しドキュメント を参照してください。

FAQ

Gemini 3.1 Pro は本当に、動画と音声入力を持つ唯一の 1M コンテキストモデルですか? 2026-07-21 時点で、はい。src/data/models.ts 内で 1M+ コンテキストウィンドウを持つ他のすべてのモデル ― DeepSeek V4 Pro、DeepSeek V4 Flash、GLM-5.2、Qwen3.7 Max/Plus、Qwen3.5 Plus/Flash、Qwen3.6 Plus、Claude Sonnet 5、Claude Opus 4.6/4.7/4.8、MiniMax M3、Longcat 2.0、Mimo V2 Pro/V2.5 ― は、テキストのみ、またはテキストと画像のみを受け付けます。video または audio の能力タグを持つものはありません。ネイティブな動画/音声入力を持つ唯一のモデルは、Gemini ファミリーそのものです。

なぜ本記事にはレイテンシやリコールのベンチマークがないのですか? 実施していないからです。そして、生ログで裏付けられない数字は掲載しません。ロングコンテキストのリコール(「干し草の山から針を探す」問題)は、プロンプト形状、位置、言語、各深さでのモデルのアテンション挙動に依存します ― テストハーネス、プロンプト、生の出力なしの単一のリコール率は、データではなくマーケティングです。ワークロードのリコール数値が必要な場合は、MeshTok 上で独自のコーパスを使って自分で実行してください。上記の料金と能力データが、安定して検証可能な部分です。

モデル ID の -preview サフィックスは問題ですか? シグナルであり、ブロッカーではありません。Google はカタログで 3.1 Pro をプレビューモデルとして公開しています(google/gemini-3.1-pro-preview)。これは通常、スペックシートは正確だが、バージョン変更なしにモデルの挙動が変わる可能性があることを意味します。最新能力よりも安定性が重要な本番ルーティングでは、Gemini 2.5 Pro がより低価格の非プレビューフラッグシップ代替品です。

Gemini 3.1 Pro は Gemini 2.5 Pro と比べてどうですか? 2.5 Pro は Google の旧フラッグシップです。より安価($2/$12 に対し $1.25/$10)で、同じ flagship + reasoning + 完全マルチモーダルのタグを持ち、同じ 1,048,576 のコンテキストウィンドウを持ちます。3.1 Pro に高い金額を払う理由:明示された 65,536 の最大出力、より新しいナレッジカットオフ(2026-05)、そして新しい 3.1 世代。2.5 Pro に留まる理由:それら3つが不要なら純粋に安く済みます。

Gemini 3.1 Pro はツール呼び出しと構造化出力をサポートしていますか? はい。capabilities フィールドに toolsjson が記載されており、ネイティブな関数呼び出しと JSON モードの構造化出力が MeshTok の OpenAI 互換エンドポイント経由でサポートされています。リクエスト形式は OpenAI と同一で、model フィールドだけが変わります。

1M コンテキストウィンドウは本物ですか、それともマーケティングですか? src/data/models.ts に記載されたコンテキストウィンドウであり、Google 自身のモデルカードから同期されたものです。実際に使えるコンテキストは、プロンプト形状、検索戦略、モデルのロングコンテキストアテンションの扱い方に依存します ― これらはすべて独自データでテストすべきです。カタログの数値はモデルが受け付ける上限であり、すべての位置での品質保証ではありません。

なぜ Gemini 3.1 Pro は DeepSeek V4 Pro よりはるかに高いのですか? コスト構造も能力も異なります。DeepSeek V4 Pro はテキスト+画像のボリューム向けに攻撃的な価格設定がされており、動画や音声を受け付けません。Gemini 3.1 Pro はネイティブな動画・音声サポートを備えた完全マルチモーダルフラッグシップとして価格設定されています ― これは同条件のテキスト比較ではなく、異なる入力サーフェスです。MeshTok は一切のマークアップを加えておらず、各研究室が公開する価格をそのまま表示しています。

この価格は安定していますか? モデルベンダーはリスト価格を定期的に更新します。本記事の数値は 2026-07-21 時点の MeshTok カタログを反映しています。ページ上部の updatedDate が記事の最終確認日を示します。ライブの信頼できる情報源は常に https://meshtok.com/models です。


最終確認 2026-07-21、MeshTok Team。すべての価格と能力は、確認日時点のライブ MeshTok モデルカタログ(src/data/models.ts)から取得しています。本記事ではレイテンシ、トークン数、リコール、品質の計測は一切行っていません ― 示された数値は公開リスト価格からの算術投影であり、経験的なベンチマークではありません。

← ブログに戻る Try MeshTok API