В большинстве рабочих сценариев начало запроса к модели повторяется из раза в раз: системная инструкция, описания инструментов, справочник, файлы проекта, история диалога. Кэширование промпта позволяет не платить за этот повтор полную цену: модель читает уже обработанное начало из кэша, и эти токены стоят в разы дешевле обычного ввода. Для чат-ботов и агентов это один из самых простых способов снизить счёт, не меняя модель.
Сколько стоит чтение из кэша
Поддержка кэша и его цена указаны в каталоге отдельно для каждого канала модели. На 25 сентября 2026 года кэш есть у канала по умолчанию почти всех текстовых моделей каталога, и у большинства из них чтение из кэша стоит десятую часть цены входа. У части моделей множитель другой — точное значение показывает страница модели и поле cacheReadRub в GET /v1/pricing.
У некоторых каналов Claude есть и цена записи в кэш: первый запрос, который кладёт префикс в кэш, стоит до 1,25 цены входа, а все последующие чтения — дешевле. У других каналов запись в кэш стоит как обычный ввод. Это тоже видно на странице модели.
Кэша нет у нескольких моделей — например, у GLM-5.3 FlashX, Grok 4.7, Mistral Small и моделей Sonar. Для них повторяющийся ввод оплачивается полностью.
Как посчитать экономию
Стоимость ввода с кэшем = (некешированные токены + прочитанные из кэша токены × множитель чтения) / 1 000 000 × цена входа. При множителе 0,1 запрос, у которого 90% ввода пришло из кэша, обходится по вводу примерно в пять раз дешевле такого же запроса без кэша. Для ориентира — живые цены входа и выхода моделей, которые чаще всего используют с длинными повторяющимися промптами, в рублях за 1 млн токенов:
| Модель | Вход | Выход |
|---|---|---|
| claude-sonnet-5 | 44 ₽/1M | 220 ₽/1M |
| claude-opus-5.5 | 65,38 ₽/1M | 326,86 ₽/1M |
| gpt-5.6-sol | 11 ₽/1M | 69 ₽/1M |
| gpt-5.6-luna | 3,78 ₽/1M | 22,63 ₽/1M |
| gemini-3.8-flash | 3,78 ₽/1M | 18,86 ₽/1M |
| deepseek-v4.1-flash | 1,14 ₽/1M | 4,53 ₽/1M |
Это не обещание, а наш замер из документации: 21 августа 2026 года агентская сессия на Claude Opus 5 через /v1/messages — 119 запросов, 15 млн входных токенов — прочитала из кэша 91,6% ввода.
Как включить кэш
Модели OpenAI: автоматически
На /v1/chat/completions у моделей семейства OpenAI кэш работает сам: если начало запроса совпадает с недавним, оно читается из кэша. Никаких специальных полей не нужно. Шлюз передаёт тело запроса без переупорядочивания полей, поэтому одинаковый префикс остаётся одинаковым.
Claude: точки cache_control
Claude кэширует только при наличии явных точек cache_control — само по себе повторение префикса кэш не включает. Если вы не поставили точку, шлюз проставляет её сам, и на /v1/messages, и на /v1/chat/completions. Если вы управляете кэшем сами, ваша разметка остаётся как есть:
curl https://plusvibeapi.ru/v1/messages \
-H "x-api-key: $PLUSVIBE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"system": [
{
"type": "text",
"text": "Большая неизменная инструкция и справочник...",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{"role": "user", "content": "Вопрос по справочнику"}]
}'
Для агентов на Claude удобнее нативный эндпоинт /v1/messages с заголовком x-api-key — им пользуются Claude Code и Anthropic SDK. Тело уходит без перевода из формата OpenAI, поэтому точки кэширования и поля cache_creation_input_tokens / cache_read_input_tokens в ответе доходят без потерь. Настройка Claude Code — в документации.
Остальные модели
Отмечен ли кэш у канала модели, показывает её страница в каталоге. Правило для всех моделей одно: кэш срабатывает только на одинаковом начале запроса.
Как построить промпт, чтобы кэш срабатывал
- Неизменное — в начало, изменчивое — в конец. Системная инструкция, описания инструментов и справочные документы идут первыми, вопрос пользователя — последним.
- Не вставляйте в начало промпта то, что меняется. Текущее время, случайный идентификатор запроса или имя пользователя в первой строке системной инструкции делают каждый запрос уникальным, и кэш не срабатывает ни разу.
- Держите порядок инструментов стабильным. Если список инструментов собирается динамически, сортируйте его одинаково в каждом запросе.
- Историю диалога дописывайте, а не переписывайте. Когда новые сообщения добавляются в конец, всё предыдущее остаётся одинаковым префиксом. Сжатие или пересборка истории сбрасывает кэш.
- Кэш временный. Выгода максимальна при частых запросах с одним и тем же префиксом — в агентном цикле или в чат-боте с потоком пользователей.
Как проверить, что кэш работает
Сколько токенов пришло из кэша, видно в поле usage каждого ответа: в формате OpenAI — prompt_tokens_details.cached_tokens, в формате Anthropic — cache_read_input_tokens. Фактическое списание по каждому запросу — в истории использования (поле cost_rub в GET /v1/generations) и в статистике запросов в личном кабинете.
Если кэш стабилен и важен для бюджета, в настройках аккаунта или конкретного API-ключа можно включить фильтр «Только с кэшем»: запросы без явного выбора канала будут идти только на каналы, которые поддерживают кэш промпта. Подробнее — в разделе «Маршрутизация и лимиты».
Итог
- Кэш снижает цену повторяющегося ввода — у большинства моделей каталога чтение из кэша стоит десятую часть входа.
- У моделей OpenAI кэш включается сам, для Claude шлюз ставит точки
cache_controlавтоматически. - Главное условие — стабильное начало запроса: всё изменчивое уходит в конец.
Другие способы снизить счёт — в статьях «Самые дешёвые LLM API в рублях» и «Reasoning в API: как управлять рассуждениями и счётом».



