Модели с режимом рассуждений перед ответом «думают»: строят план, проверяют промежуточные шаги, перебирают варианты. На сложных задачах это заметно повышает качество, но у рассуждений есть цена — время и деньги. В этой статье разбираем, как рассуждения тарифицируются, какими параметрами ими управлять в API и какой уровень выбирать под задачу.
Почему рассуждения влияют на счёт
В каталоге PlusVibe у каждой модели с рассуждениями указано, что токены рассуждения оплачиваются как выходные. Выход почти у всех моделей в несколько раз дороже входа, поэтому модель, которая «думает» несколько тысяч токенов перед коротким ответом, за один запрос может потратить больше, чем за весь видимый ответ.
Отсюда главный практический вывод: уровень рассуждений — такой же рычаг стоимости, как выбор модели. Для классификации, извлечения полей или короткого перевода глубокие рассуждения обычно не нужны; для сложного кода, математики и многошаговых задач агента — наоборот.
Сколько токенов ушло на рассуждения, видно в ответе: в формате OpenAI — поле usage.completion_tokens_details.reasoning_tokens. Сумма списания по запросу — в поле cost_rub истории использования (GET /v1/generations).
Как управлять рассуждениями: параметры
Формат параметра зависит от эндпоинта:
ЭндпоинтПараметрПример/v1/chat/completionsreasoning_effort"reasoning_effort": "low"
/v1/responsesreasoning.effort"reasoning": {"effort": "low"}
/v1/messages (Claude)thinking с budget_tokens"thinking": {"type": "enabled", "budget_tokens": 2048}
Шлюз распознаёт значения none, minimal, low, medium, high, xhigh и max. Правильное написание — medium, не middle.
Какие уровни у каких моделей
Доступные уровни зависят от модели и указаны на её странице. На 25 сентября 2026 года в каталоге так:
МоделиКак работает параметр GPT-5.6 Luna, Terra, Sol, GPT-6 Luna, GPT-6 Solшесть уровней: minimal, low, medium, high, xhigh, max GPT-6 Astra, Grok 4.3, 4.6 и 4.7четыре уровня: minimal, low, medium, high GLM, Qwenпереключатель: none, minimal и low выключают рассуждения, medium и выше — включают Geminiпереключатель: нижние уровни выключают рассуждения, medium и выше — автоматический бюджет DeepSeek, Kimiрассуждение встроено в модель и этим параметром не переключается Claudeextended thinking через объектthinking на /v1/messages
Для Claude не считайте reasoning_effort из Chat Completions эквивалентом extended thinking: используйте /v1/messages и нативный параметр thinking. Подробности и примеры на Python — в документации по режиму рассуждений.
Если маршрут не принимает какой-то параметр запроса, шлюз не снимает его молча: названия снятых параметров приходят в заголовке ответа x-pv-dropped-params. Нет заголовка — всё, что вы прислали, ушло в модель как есть.
Примеры запросов
Chat Completions
curl https://plusvibeapi.ru/v1/chat/completions \
-H "Authorization: Bearer $PLUSVIBE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-luna",
"reasoning_effort": "low",
"messages": [{"role": "user", "content": "Определи тональность отзыва: ..."}]
}'
Responses API
curl https://plusvibeapi.ru/v1/responses \
-H "Authorization: Bearer $PLUSVIBE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"reasoning": {"effort": "high"},
"input": "Найди ошибку в этом алгоритме и предложи исправление: ..."
}'
Claude: extended thinking
curl https://plusvibeapi.ru/v1/messages \
-H "x-api-key: $PLUSVIBE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-5",
"max_tokens": 8000,
"thinking": {"type": "enabled", "budget_tokens": 4000},
"messages": [{"role": "user", "content": "Спланируй миграцию базы данных: ..."}]
}'
Бюджет budget_tokens задаётся внутри max_tokens, поэтому max_tokens должен быть больше бюджета — с запасом на сам ответ.
Как выбрать уровень
- minimal или low — классификация, извлечение данных, короткие ответы по готовому контексту, перевод. Быстрее и дешевле.
- medium — разумная середина для большинства задач: ответы с рассуждением, код средней сложности.
- high, xhigh, max — сложная отладка, математика, планирование многошаговых действий агента. Дороже и медленнее, поэтому включайте там, где разница в качестве того стоит.
Оставьте запас в max_tokens. Рассуждения расходуют тот же лимит выходных токенов, что и видимый ответ: если лимит маленький, модель может истратить его на размышление и вернуть пустой текст. Если ответ пришёл пустым при непустом reasoning_tokens, первым делом увеличьте max_tokens.
Лучший способ выбрать уровень — прогнать одинаковый набор своих запросов на двух уровнях и сравнить качество и cost_rub в истории. Живые цены моделей с управляемыми рассуждениями, в рублях за 1 млн токенов (выход включает токены рассуждения):
| Модель | Вход | Выход |
|---|---|---|
| gpt-5.6-luna | 3,78 ₽/1M | 22,63 ₽/1M |
| gpt-5.6-terra | 22,13 ₽/1M | 132,76 ₽/1M |
| gpt-5.6-sol | 11 ₽/1M | 69 ₽/1M |
| gpt-6-luna | 3,81 ₽/1M | 19,07 ₽/1M |
| claude-sonnet-5 | 44 ₽/1M | 220 ₽/1M |
| deepseek-v4.1-flash | 1,14 ₽/1M | 4,53 ₽/1M |
Ещё два способа снизить счёт без потери качества — кэширование промптов и выбор модели из рейтинга «Самые дешёвые LLM API в рублях». Сравнение двух тиров GPT-5.6 — в статье «GPT-5.6 Luna против GPT-5.6 Terra».



