·4 мин. чтения

Кэширование промптов: как сократить счёт за LLM API

Кэширование промптов в API Claude, GPT и других моделей: сколько стоит чтение из кэша, как построить запрос и как проверить экономию.

Кэширование промптов: как сократить счёт за LLM API

В большинстве рабочих сценариев начало запроса к модели повторяется из раза в раз: системная инструкция, описания инструментов, справочник, файлы проекта, история диалога. Кэширование промпта позволяет не платить за этот повтор полную цену: модель читает уже обработанное начало из кэша, и эти токены стоят в разы дешевле обычного ввода. Для чат-ботов и агентов это один из самых простых способов снизить счёт, не меняя модель.

Сколько стоит чтение из кэша

Поддержка кэша и его цена указаны в каталоге отдельно для каждого канала модели. На 25 сентября 2026 года кэш есть у канала по умолчанию почти всех текстовых моделей каталога, и у большинства из них чтение из кэша стоит десятую часть цены входа. У части моделей множитель другой — точное значение показывает страница модели и поле cacheReadRub в GET /v1/pricing.

У некоторых каналов Claude есть и цена записи в кэш: первый запрос, который кладёт префикс в кэш, стоит до 1,25 цены входа, а все последующие чтения — дешевле. У других каналов запись в кэш стоит как обычный ввод. Это тоже видно на странице модели.

Кэша нет у нескольких моделей — например, у GLM-5.3 FlashX, Grok 4.7, Mistral Small и моделей Sonar. Для них повторяющийся ввод оплачивается полностью.

Как посчитать экономию

Стоимость ввода с кэшем = (некешированные токены + прочитанные из кэша токены × множитель чтения) / 1 000 000 × цена входа. При множителе 0,1 запрос, у которого 90% ввода пришло из кэша, обходится по вводу примерно в пять раз дешевле такого же запроса без кэша. Для ориентира — живые цены входа и выхода моделей, которые чаще всего используют с длинными повторяющимися промптами, в рублях за 1 млн токенов:

МодельВходВыход
claude-sonnet-544 ₽/1M220 ₽/1M
claude-opus-5.565,38 ₽/1M326,86 ₽/1M
gpt-5.6-sol11 ₽/1M69 ₽/1M
gpt-5.6-luna3,78 ₽/1M22,63 ₽/1M
gemini-3.8-flash3,78 ₽/1M18,86 ₽/1M
deepseek-v4.1-flash1,14 ₽/1M4,53 ₽/1M

Это не обещание, а наш замер из документации: 21 августа 2026 года агентская сессия на Claude Opus 5 через /v1/messages — 119 запросов, 15 млн входных токенов — прочитала из кэша 91,6% ввода.

Как включить кэш

Модели OpenAI: автоматически

На /v1/chat/completions у моделей семейства OpenAI кэш работает сам: если начало запроса совпадает с недавним, оно читается из кэша. Никаких специальных полей не нужно. Шлюз передаёт тело запроса без переупорядочивания полей, поэтому одинаковый префикс остаётся одинаковым.

Claude: точки cache_control

Claude кэширует только при наличии явных точек cache_control — само по себе повторение префикса кэш не включает. Если вы не поставили точку, шлюз проставляет её сам, и на /v1/messages, и на /v1/chat/completions. Если вы управляете кэшем сами, ваша разметка остаётся как есть:

curl https://plusvibeapi.ru/v1/messages \
  -H "x-api-key: $PLUSVIBE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "max_tokens": 1024,
    "system": [
      {
        "type": "text",
        "text": "Большая неизменная инструкция и справочник...",
        "cache_control": { "type": "ephemeral" }
      }
    ],
    "messages": [{"role": "user", "content": "Вопрос по справочнику"}]
  }'

Для агентов на Claude удобнее нативный эндпоинт /v1/messages с заголовком x-api-key — им пользуются Claude Code и Anthropic SDK. Тело уходит без перевода из формата OpenAI, поэтому точки кэширования и поля cache_creation_input_tokens / cache_read_input_tokens в ответе доходят без потерь. Настройка Claude Code — в документации.

Остальные модели

Отмечен ли кэш у канала модели, показывает её страница в каталоге. Правило для всех моделей одно: кэш срабатывает только на одинаковом начале запроса.

Как построить промпт, чтобы кэш срабатывал

  1. Неизменное — в начало, изменчивое — в конец. Системная инструкция, описания инструментов и справочные документы идут первыми, вопрос пользователя — последним.
  2. Не вставляйте в начало промпта то, что меняется. Текущее время, случайный идентификатор запроса или имя пользователя в первой строке системной инструкции делают каждый запрос уникальным, и кэш не срабатывает ни разу.
  3. Держите порядок инструментов стабильным. Если список инструментов собирается динамически, сортируйте его одинаково в каждом запросе.
  4. Историю диалога дописывайте, а не переписывайте. Когда новые сообщения добавляются в конец, всё предыдущее остаётся одинаковым префиксом. Сжатие или пересборка истории сбрасывает кэш.
  5. Кэш временный. Выгода максимальна при частых запросах с одним и тем же префиксом — в агентном цикле или в чат-боте с потоком пользователей.

Как проверить, что кэш работает

Сколько токенов пришло из кэша, видно в поле usage каждого ответа: в формате OpenAI — prompt_tokens_details.cached_tokens, в формате Anthropic — cache_read_input_tokens. Фактическое списание по каждому запросу — в истории использования (поле cost_rub в GET /v1/generations) и в статистике запросов в личном кабинете.

Если кэш стабилен и важен для бюджета, в настройках аккаунта или конкретного API-ключа можно включить фильтр «Только с кэшем»: запросы без явного выбора канала будут идти только на каналы, которые поддерживают кэш промпта. Подробнее — в разделе «Маршрутизация и лимиты».

Итог

  • Кэш снижает цену повторяющегося ввода — у большинства моделей каталога чтение из кэша стоит десятую часть входа.
  • У моделей OpenAI кэш включается сам, для Claude шлюз ставит точки cache_control автоматически.
  • Главное условие — стабильное начало запроса: всё изменчивое уходит в конец.

Другие способы снизить счёт — в статьях «Самые дешёвые LLM API в рублях» и «Reasoning в API: как управлять рассуждениями и счётом».

кэширование промптовprompt cachingкэширование промптов Claudecache_controlкэш промпта APIэкономия токенов LLMснизить стоимость LLM APIcached tokens

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

Кэширование промптов: как сократить счёт за LLM API