В каталоге MeshTok представлено более десятка моделей с контекстным окном в миллион токенов и более. Почти все они чем-то жертвуют ради этого — нет зрения, нет видео, нет аудио, небольшой максимальный вывод или отсутствует тег flagship. Gemini 3.1 Pro — исключение: контекстное окно на 1,048,576 токенов, максимальный вывод 65,536 токенов, нативный ввод изображения+видео+аудио, reasoning, tools, json и метка flagship — всё в одном идентификаторе модели. Вопрос, на который отвечает эта статья: стоит ли эта комбинация цены $2 / $12 за миллион токенов.
Это анализ спецификаций и цен, а не синтетический бенчмарк. Мы не проводили тестов задержки, не измеряли поиск «иголки в стоге сена» в каждой позиции контекста и не будем публиковать никаких цифр, которые не можем подтвердить живым каталогом. Каждая цифра ниже — арифметика, которую вы можете воспроизвести с калькулятором на основе src/data/models.ts. Цель — помочь решить, заслуживает ли миллионотоковое окно Gemini 3.1 Pro места в вашем слое маршрутизации — на основе данных, которые реально важны для бюджетирования: контекстное окно, максимальный вывод, многомодальный охват и цена за миллион токенов.
Одно честное замечание перед цифрами: идентификатор модели в каталоге — google/gemini-3.1-pro-preview. Суффикс -preview присутствует в исходных данных, и мы не будем его скрывать. Считайте спецификацию точной, но сверяйтесь с https://meshtok.com/v1/models перед окончательным решением о маршрутизации в продакшене.
Gemini 3.1 Pro: спецификация
Доступна сегодня через унифицированный API MeshTok по адресу https://meshtok.com/v1 под идентификатором модели google/gemini-3.1-pro-preview.
| Поле | Значение |
|---|---|
| Вендор | Google (США) |
| Контекстное окно | 1,048,576 токенов (2²⁰, чуть выше 1M) |
| Максимальный вывод | 65,536 токенов |
| Цена ввода (за 1M) | $2.00 |
| Цена вывода (за 1M) | $12.00 |
| Возможности | image, video, audio, reasoning, tools, json, flagship |
| Выпущена | 2026-06 |
| Отсечка знаний | 2026-05 |
В этом классе выделяются три момента:
- Самое большое совокупное окно контекст+вывод среди многомодальных моделей в каталоге. 1,048,576 ввод + 65,536 вывод означает, что один вызов может принять около миллиона токенов смешанного текста, изображений, аудио и видео и выдать ответ на 65K токенов. Ни одна другая модель в
models.tsодновременно соответствует всем трём условиям: контекст 1M+, максимальный вывод 65K+ и ввод изображение+видео+аудио. - Полностью нативная многомодальность, включая видео и аудио. Большинство конкурентов с контекстом 1M останавливаются на
image(DeepSeek V4 Pro, Qwen3.7 Max, Doubao Seed 2.1 Pro) или вообще отказываются от зрения (GLM-5.2). Gemini 3.1 Pro — единственный флагман с контекстом 1M в каталоге, который принимает видео и аудио нативно наряду с текстом и изображениями. - Помечена как
flagshipиreasoning. Google применяет те же теги возможностей, что резервирует для фронтального класса. Более дешёвые варианты Gemini Flash несутfastвместоreasoningиflagship— это структурный разрыв внутри семейства.
Вопрос на миллион токенов: сколько реально стоит контекст 1M?
Эту часть большинство маркетинговых страниц пропускают. Миллионотоковое контекстное окно — это бюджет, а не бесплатное приложение. Каждый токен, который вы подаёте, тарифицируется по ставке ввода. Честный способ сравнивать модели с длинным контекстом — посчитать стоимость фактического использования окна.
Стоимость одного полностью загруженного вызова (1M ввод + короткая выжимка)
Типичная нагрузка с длинным контекстом: отправить ~1M токенов документов и попросить короткую выжимку или несколько пунктов действий. Предполагаем 1,048,576 входных токенов и 1,000 выходных.
| Модель | Стоимость ввода | Стоимость вывода | Итого за вызов |
|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | $0.012 | $2.109 |
| Gemini 2.5 Pro | $1.311 | $0.010 | $1.321 |
| Gemini 3 Flash | $0.524 | $0.003 | $0.527 |
| DeepSeek V4 Pro | $0.449 | $0.001 | $0.450 |
| GLM-5.2 | $1.143 | $0.004 | $1.147 |
| Claude Sonnet 5 | $3.000 | $0.015 | $3.015 |
Один полностью загруженный вызов Gemini 3.1 Pro стоит около $2.11. Запускайте это тысячу раз в день — и вы тратите $2,109/день, примерно $63K/месяц, только на входных токенах. Это не повод избегать модель; это повод осознанно подходить к тому, когда вам реально нужно полное окно.
Стоимость полностью загруженного вызова с длинным выводом (1M ввод + полный максимальный вывод)
Там, где ценообразование Gemini 3.1 Pro становится структурно иным, — когда вы также используете большой максимальный вывод. Здесь предполагаем, что контекст заполнен до краёв и модели разрешено выдать полный максимальный вывод.
| Модель | 1M ввод | Использован макс. вывод | Стоимость вывода | Итого за вызов |
|---|---|---|---|---|
| Gemini 3.1 Pro | $2.097 | 65,536 | $0.786 | $2.883 |
| GLM-5.2 | $1.143 | 128,000 | $0.512 | $1.655 |
| DeepSeek V4 Pro | $0.449 | 32,768 | $0.028 | $0.477 |
| Claude Sonnet 5 | $3.000 | 16,384 | $0.246 | $3.246 |
GLM-5.2 дешевле на полностью загруженный вызов, потому что его максимальный вывод 128K, но оценивается в $4/1M, а не $12/1M. Решающий фактор между Gemini 3.1 Pro и GLM-5.2 — не цена, а нужно ли вам ввод видео и аудио, который GLM-5.2 вообще не принимает.
Стоимость 1 миллиона коротких чат-вызовов (1K ввод + 500 вывод каждый)
Для проверки на другом конце спектра: миллион коротких вызовов, каждый потребляет 1,000 входных и генерирует 500 выходных токенов. Это суммарно 1 миллиард входных и 500 миллионов выходных токенов.
| Модель | Стоимость ввода (1B в) | Стоимость вывода (500M вых) | Итого за 1M вызовов |
|---|---|---|---|
| Gemini 3.1 Pro | $2,000 | $6,000 | $8,000 |
| Gemini 2.5 Pro | $1,250 | $5,000 | $6,250 |
| Gemini 3 Flash | $500 | $1,500 | $2,000 |
| DeepSeek V4 Pro | $429 | $429 | $857 |
| GLM-5.2 | $1,143 | $2,000 | $3,143 |
| Claude Sonnet 5 | $3,000 | $7,500 | $10,500 |
На коротком чат-трафике Gemini 3.1 Pro примерно в 9.3× дороже, чем DeepSeek V4 Pro, и в 2.5× дороже, чем GLM-5.2. Урок прост: миллионотоковое окно — премиум-функция, и не следует платить за неё на трафике, который его никогда не использует.
Внутри семейства Gemini: какую выбрать?
В каталоге MeshTok представлено семь моделей Gemini с контекстным окном класса 1M. Выбор подходящей — это в основном компромисс между глубиной рассуждений, многомодальным охватом и ценой.
| Модель | Контекст | Макс. вывод | Ввод $/M | Вывод $/M | Видео | Аудио | Рассуждения | Флагман |
|---|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 2.5 Pro | 1,048,576 | — | $1.25 | $10.00 | ✅ | ✅ | ✅ | ✅ |
| Gemini 3.5 Flash | 1,048,576 | 65,536 | $1.50 | $9.00 | ✅ | ✅ | — | — |
| Gemini 3 Flash | 1,048,576 | 65,536 | $0.50 | $3.00 | ✅ | ✅ | — | — |
| Gemini 3.1 Flash Lite | 1,048,576 | — | $0.25 | $1.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash | 1,048,576 | — | $0.30 | $2.50 | ✅ | ✅ | — | — |
| Gemini 2.5 Flash Lite | 1,000,000 | — | $0.10 | $0.40 | ✅ | ✅ | — | — |
Чтение матрицы:
- Gemini 3.1 Pro против Gemini 2.5 Pro — 2.5 Pro — старый флагман и дешевле по обеим осям ($1.25/$10 против $2/$12). Аргументы за доплату за 3.1 Pro: заданный максимальный вывод 65,536 (у записи 2.5 Pro в каталоге нет явного
maxOutput), более свежая отсечка знаний (2026-05) и новое поколение 3.1. Аргументы за то, чтобы остаться на 2.5 Pro: если вам это не нужно, она строго дешевле. - Gemini 3.1 Pro против Gemini 3 Flash — Flash вчетверо дешевле и имеет тот же контекст 1M, максимальный вывод 65K и полный многомодальный ввод. Чем вы жертвуете —
reasoningиflagship. Для высокообъёмной многомодальной классификации, транскрипции или маршрутизации, где пошаговое мышление не требуется, Flash — правильный выбор. Для всего, что выигрывает от цепочек рассуждений — многошаговый анализ, Q&A по длинным документам с синтезом — 3.1 Pro — апгрейд. - Gemini 3.1 Pro против Gemini 3.1 Flash Lite / 2.5 Flash Lite — варианты Lite — это бюджетный сегмент. Они сохраняют контекст 1M и многомодальный ввод, но отказываются от рассуждений и явного ограничения максимального вывода. Используйте их, когда нужно дёшево принять много токенов и планка качества ответа умеренная.
Gemini 3.1 Pro против других 1M-флагманов
Как Gemini 3.1 Pro соотносится с более известными 1M-флагманами из других лабораторий?
| Модель | Контекст | Макс. вывод | Ввод $/M | Вывод $/M | Видео | Аудио | Выпущена |
|---|---|---|---|---|---|---|---|
| Gemini 3.1 Pro | 1,048,576 | 65,536 | $2.00 | $12.00 | ✅ | ✅ | 2026-06 |
| DeepSeek V4 Pro | 1,000,000 | 32,768 | $0.4286 | $0.8571 | — | — | 2026-04 |
| GLM-5.2 | 1,000,000 | 128,000 | $1.1429 | $4.0000 | — | — | 2026-07 |
| Qwen3.7 Max | 1,000,000 | 8,192 | $0.8571 | $2.5714 | — | — | 2026-06 |
| Claude Sonnet 5 | 1,000,000 | 16,384 | $3.0000 | $15.0000 | — | — | 2026-05 |
| Claude Opus 4.8 | 1,000,000 | 32,000 | $5.0000 | $25.0000 | — | — | 2026-06 |
Два структурных наблюдения:
- Gemini 3.1 Pro — единственная модель в этой таблице с нативным вводом видео и аудио. Все остальные 1M-флагманы принимают максимум изображения. Если ваша нагрузка — понимание видео, транскрипция встреч или любой конвейер, принимающий аудио/видео вместе с текстом, Gemini 3.1 Pro — не самый дешёвый вариант, а единственный в классе 1M-контекста.
- У GLM-5.2 самый большой максимальный вывод (128K), но вообще нет многомодальности. Если ваша нагрузка требует генерации очень длинных одноходовых текстовых ответов из текстового ввода, GLM-5.2 и дешевле, и имеет более длинное окно вывода. Как только нужно изображение, видео или аудио, GLM-5.2 отпадает и Gemini 3.1 Pro возвращается в разговор.
Компромисс «длинный контекст против RAG» (честный ответ)
Вопрос «стоит ли миллионотоковое окно?» почти всегда сводится к вопросу стоимости, а не возможностей. Контекст 1M позволяет пропустить конвейер поиска и просто свалить всё в промпт. Это удобно, но при $2/1M ввода это также дорого при каждом вызове — и вы платите снова при следующем вызове, потому что контекстное окно не кешируется бесплатно.
Простое эмпирическое правило, выведенное исключительно из цен выше:
- Если один и тот же большой корпус запрашивается много раз, ретривал дешевле. Отправляйте 5K извлечённых токенов по $2/1M = $0.01 за вызов вместо 1M токенов по $2/1M = $2.00 за вызов. Точка безубыточности — примерно 200 вызовов только с извлечёнными токенами на каждый вызов с полным контекстом.
- Если корпус запрашивается один-два раза и затем отбрасывается (разовая выжимка свежей транскрипции, одиночный глубокий прогон контракта, ad-hoc исследование кодовой базы), длинный контекст — правильный инструмент. Система ретривала обойдётся дороже в разработке, чем сэкономит токенов.
- Если нужно понимание аудио или видео на длинной дистанции (двухчасовая запись встречи, длинное видео), Gemini 3.1 Pro — единственная модель в каталоге, объединяющая эту модальность ввода с окном 1M. Более дешёвой замены в классе 1M нет — компромисс между Gemini 3.1 Pro и моделью с более коротким контекстом плюс чанкинг.
Когда выбирать Gemini 3.1 Pro (а когда нет)
«Лучшей модели» не существует — есть только подходящая модель для конкретной нагрузки и бюджета. Используйте эту матрицу как отправную точку и валидируйте собственной оценкой.
| Нагрузка | Рекомендация | Почему |
|---|---|---|
| Понимание длинного видео или аудио (1M+ токенов медиа) | Gemini 3.1 Pro | Единственная 1M-модель в каталоге с нативным вводом video и audio. Более дешёвой замены в этом классе нет. |
| Смешанный многомодальный анализ длинного контекста (текст + изображения + аудио) | Gemini 3.1 Pro | Единственный флагман, объединяющий контекст 1M, максимальный вывод 65K и полный многомодальный ввод. |
| Длинный контекст только текст с очень длинным выводом (>65K, до 128K) | GLM-5.2 | Максимальный вывод 128K у GLM-5.2 уникален. Дешевле на полностью загруженных вызовах с длинным выводом. Без зрения. |
| Высокообъёмный 1M-контекст многомодальный с ограниченным бюджетом | Gemini 3 Flash | Вчетверо дешевле 3.1 Pro, тот же контекст 1M, тот же многомодальный ввод. Без рассуждений. |
| Самый дешёвый возможный контекст 1M (текст или изображение) | DeepSeek V4 Pro | $0.43/1M ввода — в 4.7× дешевле Gemini 3.1 Pro по вводу. Без видео/аудио. |
| Кодинг высшего класса, стоимость вторична | Claude Sonnet 5 | Позиционирование Anthropic и оценки сообщества ставят Sonnet 5 на первое место по коду. Gemini 3.1 Pro, если многомодальный длинный контекст важнее. |
| Длинно-контекстный аналитический разбор, где многомодальность не нужна | GLM-5.2 или DeepSeek V4 Pro | Обе дешевле для текстовой длинно-контекстной работы. GLM-5.2 для длинного вывода, V4 Pro для минимальной стоимости. |
Разумная политика маршрутизации по умолчанию: направлять любой вызов с видео или аудио на Gemini 3.1 Pro; длинные только-текстовые рефакторинги с очень длинным выводом — на GLM-5.2; дешёвый высокообъёмный трафик «текст+изображение» — на DeepSeek V4 Pro; зарезервировать Claude Sonnet 5 для критичного кодинга. Gemini 3.1 Pro — многомодальный длинно-контекстный специалист, а не дефолт для всего.
Как вызывать Gemini 3.1 Pro (реальный работающий код)
MeshTok предоставляет единый OpenAI-совместимый эндпоинт по адресу https://meshtok.com/v1. Переключение между Gemini 3.1 Pro и любой другой моделью в этой статье — однострочное изменение поля model — тот же SDK, тот же API-ключ, тот же формат запроса. Пример ниже показывает паттерн длинного многомодального контекста: длинный текстовый промпт плюс URL изображения, отправленные одним вызовом.
# pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://meshtok.com/v1",
api_key="sk-your-meshtok-key",
)
def ask(model_id: str, prompt: str, image_url: str | None = None) -> str:
"""Same call, different model and modality — switch with one string."""
content = [{"type": "text", "text": prompt}]
if image_url:
content.append({"type": "image_url", "image_url": {"url": image_url}})
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": content}],
)
return resp.choices[0].message.content
# Real model IDs from the MeshTok catalog
multimodal_long = ask("google/gemini-3.1-pro-preview",
"Summarize this 800K-token transcript and extract action items.",
image_url="https://example.com/chart.png")
text_only_long = ask("bigmodel/glm-5.2",
"Rewrite this 50K-token file with the new API.")
cheap_long = ask("deepseek/deepseek-v4-pro",
"Summarize this 200K-token document.")
coding_flagship = ask("anthropic/claude-sonnet-5",
"Refactor this Python function and add tests.")
Стриминг, вызов инструментов, JSON-режим и ввод изображения работают одинаково — измените строку model и добавьте соответствующие параметры. Для стриминга ответов передайте stream=True; для вызова инструментов — аргумент tools; для структурированного вывода используйте response_format={"type": "json_object"}. См. документацию по стримингу MeshTok и документацию по вызову инструментов с полными примерами на Python, JavaScript и cURL.
FAQ
Действительно ли Gemini 3.1 Pro — единственная 1M-модель с вводом видео и аудио?
По состоянию на 2026-07-21 — да. Все остальные модели в src/data/models.ts с контекстным окном 1M+ — DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.2, Qwen3.7 Max/Plus, Qwen3.5 Plus/Flash, Qwen3.6 Plus, Claude Sonnet 5, Claude Opus 4.6/4.7/4.8, MiniMax M3, Longcat 2.0, Mimo V2 Pro/V2.5 — принимают либо только текст, либо текст плюс изображения. Ни одна не несёт тега video или audio. Единственные модели с нативным вводом видео/аудио — само семейство Gemini.
Почему в статье нет бенчмарков задержки или полноты? Потому что мы их не проводили и не будем публиковать цифры, которые не можем подтвердить сырыми логами. Полнота на длинном контексте (вопрос «иголки в стоге сена») зависит от формы промпта, позиции, языка и поведения внимания модели на каждой глубине — единичный процент полноты без испытательного стенда, промптов и сырых выводов — это маркетинг, а не данные. Если вам нужны цифры полноты для своей нагрузки — прогоните их сами на MeshTok со своим корпусом. Данные по ценам и возможностям выше — та часть, которая стабильна и проверяема.
Является ли суффикс -preview в идентификаторе модели проблемой?
Это сигнал, а не блокиратор. Google поставляет 3.1 Pro как preview-модель в каталоге (google/gemini-3.1-pro-preview). Обычно это означает, что спецификация точна, но модель может менять поведение без смены версии. Для продакшен-маршрутизации, где стабильность важнее новейших возможностей, Gemini 2.5 Pro — не-preview флагманская альтернатива по более низкой цене.
Как Gemini 3.1 Pro соотносится с Gemini 2.5 Pro?
2.5 Pro — старый флагман Google. Он дешевле ($1.25/$10 против $2/$12), несёт те же теги flagship + reasoning + полная многомодальность и имеет то же контекстное окно 1,048,576. Аргументы за доплату за 3.1 Pro: заданный максимальный вывод 65,536, более свежая отсечка знаний (2026-05) и новое поколение 3.1. Аргументы за то, чтобы остаться на 2.5 Pro: строго дешевле, если эти три вещи не нужны.
Поддерживает ли Gemini 3.1 Pro вызов инструментов и структурированный вывод?
Да. Поле capabilities перечисляет tools и json, что означает, что нативный вызов функций и структурированный вывод в режиме JSON оба поддерживаются через OpenAI-совместимый эндпоинт MeshTok. Формат запроса идентичен OpenAI — меняется только поле model.
Реально ли контекстное окно 1M или это маркетинг?
Это заявленное контекстное окно в src/data/models.ts, отражённое из модельной карточки Google. Реальный usable-контекст зависит от формы промпта, стратегии ретривала и того, как модель обрабатывает внимание на длинном контексте — всё это стоит тестировать на ваших данных. Цифра в каталоге — верхняя граница, которую модель принимает, а не гарантия качества в каждой позиции.
Почему Gemini 3.1 Pro настолько дороже, чем DeepSeek V4 Pro? Разные структуры затрат и разные возможности. DeepSeek V4 Pro агрессивно оценён для объёма «текст+изображение» и не принимает видео или аудио. Gemini 3.1 Pro оценён как полноценный многомодальный флагман с нативной поддержкой видео и аудио — это другая поверхность ввода, а не эквивалентное текстовое сравнение. MeshTok не добавляет наценки; вы видите ровно то, что публикует каждая лаборатория.
Стабильны ли эти цены?
Вендоры моделей периодически обновляют прайс-листы. Цифры в этой статье отражают каталог MeshTok на 2026-07-21. updatedDate вверху страницы сообщает, когда статья была последний раз пересмотрена; живой источник истины — всегда https://meshtok.com/models.
Последний раз пересмотрено 2026-07-21 командой MeshTok. Все цены и возможности взяты из живого каталога моделей MeshTok (src/data/models.ts) на дату пересмотра. Никаких измерений задержки, подсчёта токенов, полноты или качества для этой статьи не проводилось — показанные цифры являются арифметическими проекциями из опубликованных прайс-листов, а не эмпирическими бенчмарками.