·4 мин. чтения

Модели с контекстом 1 млн токенов: что выбрать

Модели с окном 1 млн токенов в API: GPT-5.6 Sol, Claude, Gemini, GLM, DeepSeek. Окно, максимальный ответ, изображения и живые цены.

Модели с контекстом 1 млн токенов: что выбрать

Окно контекста — это сколько токенов модель принимает в одном запросе: инструкция, история диалога, документы и файлы вместе. Модели с окном около миллиона токенов позволяют отправить целиком большую часть кодовой базы, пакет договоров или длинную историю работы агента — без нарезки на куски. Ниже — все такие модели из каталога PlusVibe, их характеристики и живые цены.

Какие модели принимают 1 млн токенов

Значения взяты из карточек моделей в каталоге на 25 сентября 2026 года — это те же цифры, что показывают страницы моделей.

МодельРазработчикОкно контекстаМаксимальный ответИзображения на входе GPT-5.6 SolOpenAI1 050 000128 000да Claude Opus 5.5Anthropic1 000 000128 000да Claude Opus 5Anthropic1 000 000128 000да Claude Sonnet 5Anthropic1 000 00064 000да Claude Opus 4.7Anthropic1 000 000128 000да Claude Opus 4.6Anthropic1 000 000128 000да Gemini 3.1 ProGoogle1 000 00065 000да Gemini 3.8 FlashGoogle1 000 00065 000да Gemini 3.7 FlashGoogle1 000 00065 000да Gemini 3.5 FlashGoogle1 000 00065 000да Gemini 3.1 Flash LiteGoogle1 000 00032 000да DeepSeek V4.1 FlashDeepSeek1 000 000393 216да GLM-5.3Zhipu AI1 048 000128 000да GLM-5.3 FlashZhipu AI1 048 000128 000да GLM-5.3 FlashXZhipu AI1 048 000не указаннет GLM-5.2Zhipu AI1 048 000128 000нет GLM-5.1Zhipu AI1 048 00032 000да MiniMax M2.5MiniMax1 000 00064 000нет

Все модели из таблицы поддерживают вызов инструментов (tool calling), поэтому подходят и для агентов, а не только для разовых запросов.

Сколько это стоит

Вы платите за фактически переданные и полученные токены, а не за размер окна: короткий вопрос к модели с окном в миллион стоит как короткий вопрос. Но если вы действительно отправляете сотни тысяч токенов, цена входа становится главной статьёй расходов. Живые цены основных вариантов, в рублях за 1 млн токенов:

МодельВходВыход
deepseek-v4.1-flash1,14 ₽/1M4,53 ₽/1M
glm-5.22,96 ₽/1M9,3 ₽/1M
gemini-3.8-flash3,78 ₽/1M18,86 ₽/1M
glm-5.3-flash9,51 ₽/1M31,7 ₽/1M
gpt-5.6-sol11 ₽/1M69 ₽/1M
glm-5.316,56 ₽/1M52,05 ₽/1M
claude-sonnet-544 ₽/1M220 ₽/1M
claude-opus-5.565,38 ₽/1M326,86 ₽/1M

Пример расчёта: запрос с 500 000 входных токенов и 4 000 выходных стоит 0,5 × цена входа + 0,004 × цена выхода. На длинном вводе разница в цене входа между строками таблицы превращается в заметную сумму на каждом запросе.

Как не переплачивать за длинный контекст

Кешируйте то, что повторяется

Если один и тот же большой документ или репозиторий уходит в каждом запросе, поставьте его в начало промпта и не меняйте между вызовами. Тогда при повторе он читается из кэша — у большинства моделей из таблицы по сниженной цене. Как это работает у разных моделей — в статье «Кэширование промптов» и в документации.

Не отправляйте всё, если нужен ответ по фрагменту

Большое окно не отменяет поиска по документам. Если база знаний большая и вопросы к ней частые, дешевле найти нужные фрагменты через эмбеддинги и отправить модели только их. Модели для векторного поиска описаны в разделе «Эмбеддинги».

Следите за фактическим числом токенов

Сколько токенов занял ваш текст, зависит от языка и токенизатора конкретной модели — один и тот же документ у разных моделей весит по-разному. Точное число возвращается в поле usage.prompt_tokens каждого ответа, а сумма списания — в истории использования (GET /v1/generations).

Окно может зависеть от канала

У модели в каталоге может быть несколько каналов, и размер окна у них иногда различается. Например, у Claude Fable 5.1 канал по умолчанию принимает до 900 000 токенов, а часть других каналов — до 1 000 000. Если ваша задача упирается в предел окна, проверьте значение для конкретного канала на странице модели и, если нужно, выберите канал явно через суффикс в имени модели. Как устроен выбор канала — в разделе «Маршрутизация и лимиты».

Отдельно смотрите на максимальный ответ: окно контекста ограничивает вход и выход вместе, а максимальный ответ — только выход. Для генерации длинного кода или отчёта важна именно вторая цифра: у DeepSeek V4.1 Flash она самая большая в таблице.

Как выбрать

Качество ответа на длинном контексте у разных моделей разное, и заранее его не угадать: проверьте две-три модели на своём документе. Все модели доступны по одному ключу через OpenAI-совместимый API, поэтому сравнение — это смена поля model. Полный список моделей с ценами — в каталоге, а рейтинг по цене — в статье «Самые дешёвые LLM API в рублях».

модель с большим контекстом APIконтекст 1 млн токеновLLM с длинным контекстоммиллион токенов контекстGPT-5.6 Sol контекстClaude 1M контекстGemini 1M токеновGLM-5.3 контекст

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

Модели с контекстом 1 млн токенов: что выбрать