·4 мин. чтения

Самые дешёвые LLM API в рублях: живой рейтинг

Самые дешёвые языковые модели по API с оплатой в рублях: живая таблица цен из каталога, из чего складывается счёт и как платить меньше.

Самые дешёвые LLM API в рублях: живой рейтинг

Цены на API языковых моделей меняются каждые несколько недель, поэтому рейтинг со статичными цифрами устаревает раньше, чем его дочитают. В этой статье цены не вписаны вручную: таблица ниже подставляет их из каталога PlusVibe в момент, когда вы открываете страницу. Это те же значения, что показывает каталог моделей и страница каждой модели.

Рейтинг: самые дешёвые текстовые модели

В таблицу вошли модели с самой низкой ценой входа по каналу по умолчанию. Порядок строк мы составили по каталогу на 25 сентября 2026 года; цены в ячейках — живые, в рублях за 1 млн токенов:

МодельВходВыход
deepseek-v4.1-flash1,14 ₽/1M4,53 ₽/1M
minimax-m2.71,88 ₽/1M6,63 ₽/1M
deepseek-v4-flash-07312,05 ₽/1M6,14 ₽/1M
qwen3.8-flash2,11 ₽/1M6,2 ₽/1M
minimax-m2.52,86 ₽/1M11,45 ₽/1M
glm-5.22,96 ₽/1M9,3 ₽/1M
gemini-3.8-flash3,78 ₽/1M18,86 ₽/1M
gpt-5.6-luna3,78 ₽/1M22,63 ₽/1M
gpt-6-luna3,81 ₽/1M19,07 ₽/1M
gemini-3.7-flash4 ₽/1M22 ₽/1M
glm-5.3-flashx4,56 ₽/1M15,4 ₽/1M
qwen3.8-max5,28 ₽/1M15,84 ₽/1M

Если после обновления каталога какая-то модель подешевела или подорожала, цифры в таблице изменятся сами, а порядок строк может перестать совпадать с ценой. Точную цену и все каналы модели всегда показывает её страница.

Чем отличаются модели из таблицы

Дешёвая модель полезна, только если она умеет то, что нужно задаче. Ниже — характеристики из карточек каталога.

МодельРазработчикОкно контекстаИзображения на входеРассуждения DeepSeek V4.1 FlashDeepSeek1 000 000даthinking MiniMax M2.7MiniMax200 000нет— Qwen 3.8 FlashAlibaba (Qwen)256 000нетthinking MiniMax M2.5MiniMax1 000 000нетthinking GLM-5.2Zhipu AI1 048 000нетthinking Gemini 3.8 FlashGoogle1 000 000даthinking GPT-5.6 LunaOpenAI400 000даот minimal до max GPT-6 LunaOpenAI272 000даот minimal до max Qwen3.8 MaxAlibaba (Qwen)256 000даthinking

Из таблицы видно, как выбирать:

Качество ответов на вашей задаче таблица не покажет — его проверяют на своих примерах. Удобнее всего прогнать одинаковый набор запросов через две-три модели из рейтинга и сравнить результат и фактическое списание в истории запросов.

Цена за 1M токенов — ещё не весь счёт

Итоговая сумма зависит от того, как модель расходует токены, а не только от строки в прайсе.

Выход дороже входа

Почти у всех моделей выходной токен стоит в несколько раз дороже входного. Для задач с длинным ответом (генерация текста, код) важнее цена выхода, для задач с длинным вводом и коротким ответом (классификация, извлечение данных, поиск по документам) — цена входа.

Рассуждения оплачиваются как выход

У моделей с режимом рассуждений токены размышления в каталоге помечены как тарифицируемые по цене выхода. Модель, которая дёшево стоит за токен, но долго думает над каждым ответом, может обойтись дороже модели подороже, отвечающей сразу. Уровень рассуждений можно понизить параметром reasoning_effort — см. документацию по режиму рассуждений.

Повторяющийся ввод можно кешировать

У большинства моделей из рейтинга есть кэш промпта: повторяющееся начало запроса читается из кэша по сниженной цене — в каталоге для многих каналов это десятая часть цены входа. Для чат-ботов с длинной инструкцией и агентов это заметная экономия. Подробно — в статье «Кэширование промптов».

Как посчитать запрос: стоимость = входные токены / 1 000 000 × цена входа + выходные токены / 1 000 000 × цена выхода. Токены рассуждения входят в выходные. Фактическое списание по каждому запросу видно в поле cost_rub истории использования (GET /v1/generations) и в заголовке x-pv-cost-rub.

Как платить меньше на той же модели

У многих моделей в каталоге несколько каналов с разной ценой — все они перечислены на странице модели. Выбрать канал можно двумя способами.

  • Стратегия «по цене». В настройках аккаунта или отдельного API-ключа выберите стратегию маршрутизации price: для запросов без суффикса шлюз будет брать самый дешёвый доступный канал модели. Описание — в разделе «Маршрутизация и лимиты».
  • Явный выбор канала. Если нужный канал известен, укажите его в имени модели через двоеточие, как показано на странице модели в колонке «В API».

Для ключа можно задать и лимит цены за 1 млн токенов: запросы к каналам дороже этого порога ключ использовать не будет. Остальные способы держать расходы под контролем собраны в статье «Контроль расходов на API в команде».

Как подключить

API совместим с OpenAI: достаточно заменить адрес и ключ в любом клиенте или SDK. Пример для DeepSeek V4.1 Flash:

curl https://plusvibeapi.ru/v1/chat/completions \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash",
    "messages": [{"role": "user", "content": "Сократи этот текст до трёх пунктов: ..."}]
  }'

Чтобы перейти на другую модель из рейтинга, достаточно поменять значение поля model. Баланс один и пополняется в рублях — картой, через СБП или по счёту для организаций.

Итог

  • Самая низкая цена за токен — у моделей из верхних строк таблицы; актуальные цифры всегда на этой странице и в каталоге.
  • Смотрите не только на цену входа: выход, рассуждения и кэш меняют итоговый счёт сильнее, чем разница между соседними строками рейтинга.
  • Стратегия маршрутизации «по цене» и лимит цены на ключ позволяют платить меньше, не меняя код.

Если выбираете провайдера API, а не только модель, пригодится чек-лист «Как выбрать LLM API в России». Сравнение двух соседних тиров одной линейки — в статье «GPT-5.6 Luna против GPT-5.6 Terra».

дешёвый API нейросетисамая дешёвая модель APIдешёвые LLM APILLM API в рубляхцена API за 1M токеновDeepSeek V4.1 Flash ценаGPT-5.6 Luna ценаAPI нейросети недорого

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

Самые дешёвые LLM API в рублях: живой рейтинг | PlusVibe API