·4 мин. чтения

Reasoning в API: как управлять рассуждениями и счётом

Что такое reasoning_effort и thinking в API, как рассуждения влияют на стоимость запроса и какой уровень выбрать для GPT, Claude, Gemini.

Reasoning в API: как управлять рассуждениями и счётом

Модели с режимом рассуждений перед ответом «думают»: строят план, проверяют промежуточные шаги, перебирают варианты. На сложных задачах это заметно повышает качество, но у рассуждений есть цена — время и деньги. В этой статье разбираем, как рассуждения тарифицируются, какими параметрами ими управлять в API и какой уровень выбирать под задачу.

Почему рассуждения влияют на счёт

В каталоге PlusVibe у каждой модели с рассуждениями указано, что токены рассуждения оплачиваются как выходные. Выход почти у всех моделей в несколько раз дороже входа, поэтому модель, которая «думает» несколько тысяч токенов перед коротким ответом, за один запрос может потратить больше, чем за весь видимый ответ.

Отсюда главный практический вывод: уровень рассуждений — такой же рычаг стоимости, как выбор модели. Для классификации, извлечения полей или короткого перевода глубокие рассуждения обычно не нужны; для сложного кода, математики и многошаговых задач агента — наоборот.

Сколько токенов ушло на рассуждения, видно в ответе: в формате OpenAI — поле usage.completion_tokens_details.reasoning_tokens. Сумма списания по запросу — в поле cost_rub истории использования (GET /v1/generations).

Как управлять рассуждениями: параметры

Формат параметра зависит от эндпоинта:

ЭндпоинтПараметрПример /v1/chat/completionsreasoning_effort"reasoning_effort": "low" /v1/responsesreasoning.effort"reasoning": {"effort": "low"} /v1/messages (Claude)thinking с budget_tokens"thinking": {"type": "enabled", "budget_tokens": 2048}

Шлюз распознаёт значения none, minimal, low, medium, high, xhigh и max. Правильное написание — medium, не middle.

Какие уровни у каких моделей

Доступные уровни зависят от модели и указаны на её странице. На 25 сентября 2026 года в каталоге так:

МоделиКак работает параметр GPT-5.6 Luna, Terra, Sol, GPT-6 Luna, GPT-6 Solшесть уровней: minimal, low, medium, high, xhigh, max GPT-6 Astra, Grok 4.3, 4.6 и 4.7четыре уровня: minimal, low, medium, high GLM, Qwenпереключатель: none, minimal и low выключают рассуждения, medium и выше — включают Geminiпереключатель: нижние уровни выключают рассуждения, medium и выше — автоматический бюджет DeepSeek, Kimiрассуждение встроено в модель и этим параметром не переключается Claudeextended thinking через объект thinking на /v1/messages

Для Claude не считайте reasoning_effort из Chat Completions эквивалентом extended thinking: используйте /v1/messages и нативный параметр thinking. Подробности и примеры на Python — в документации по режиму рассуждений.

Если маршрут не принимает какой-то параметр запроса, шлюз не снимает его молча: названия снятых параметров приходят в заголовке ответа x-pv-dropped-params. Нет заголовка — всё, что вы прислали, ушло в модель как есть.

Примеры запросов

Chat Completions

curl https://plusvibeapi.ru/v1/chat/completions \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-luna",
    "reasoning_effort": "low",
    "messages": [{"role": "user", "content": "Определи тональность отзыва: ..."}]
  }'

Responses API

curl https://plusvibeapi.ru/v1/responses \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-5.6-sol",
    "reasoning": {"effort": "high"},
    "input": "Найди ошибку в этом алгоритме и предложи исправление: ..."
  }'

Claude: extended thinking

curl https://plusvibeapi.ru/v1/messages \
  -H "x-api-key: $PLUSVIBE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "max_tokens": 8000,
    "thinking": {"type": "enabled", "budget_tokens": 4000},
    "messages": [{"role": "user", "content": "Спланируй миграцию базы данных: ..."}]
  }'

Бюджет budget_tokens задаётся внутри max_tokens, поэтому max_tokens должен быть больше бюджета — с запасом на сам ответ.

Как выбрать уровень

  • minimal или low — классификация, извлечение данных, короткие ответы по готовому контексту, перевод. Быстрее и дешевле.
  • medium — разумная середина для большинства задач: ответы с рассуждением, код средней сложности.
  • high, xhigh, max — сложная отладка, математика, планирование многошаговых действий агента. Дороже и медленнее, поэтому включайте там, где разница в качестве того стоит.

Оставьте запас в max_tokens. Рассуждения расходуют тот же лимит выходных токенов, что и видимый ответ: если лимит маленький, модель может истратить его на размышление и вернуть пустой текст. Если ответ пришёл пустым при непустом reasoning_tokens, первым делом увеличьте max_tokens.

Лучший способ выбрать уровень — прогнать одинаковый набор своих запросов на двух уровнях и сравнить качество и cost_rub в истории. Живые цены моделей с управляемыми рассуждениями, в рублях за 1 млн токенов (выход включает токены рассуждения):

МодельВходВыход
gpt-5.6-luna3,78 ₽/1M22,63 ₽/1M
gpt-5.6-terra22,13 ₽/1M132,76 ₽/1M
gpt-5.6-sol11 ₽/1M69 ₽/1M
gpt-6-luna3,81 ₽/1M19,07 ₽/1M
claude-sonnet-544 ₽/1M220 ₽/1M
deepseek-v4.1-flash1,14 ₽/1M4,53 ₽/1M

Ещё два способа снизить счёт без потери качества — кэширование промптов и выбор модели из рейтинга «Самые дешёвые LLM API в рублях». Сравнение двух тиров GPT-5.6 — в статье «GPT-5.6 Luna против GPT-5.6 Terra».

reasoning_effortthinking tokens ценарежим рассуждений APIextended thinking APIreasoning tokensbudget_tokens Claudereasoning effort GPT-5.6стоимость рассуждений LLM

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

Reasoning в API: как управлять рассуждениями и счётом