Распознавание речи через API в России: 5 моделей, цены за минуту и подключение без VPN
Голосовых данных у продуктов становится больше с каждым месяцем: звонки в поддержку и продажи, созвоны команд, видео и подкасты, голосовые сообщения. Для разработчика это четыре типовые задачи: транскрибация звонков для CRM и анализа разговоров, субтитры к видео, голосовой бот, который понимает речь на слух, и заметки со встреч с разделением по говорящим. Все они упираются в один и тот же вопрос: какой API распознавания речи взять, если ты в России, платишь в рублях и не хочешь строить продакшен на VPN.
Прямой путь к западным платформам закрыт практикой: американские сервисы не работают с российскими IP и картами, не дают закрывающих документов, а обходные маршруты нестабильны. Рабочее решение — российский агрегатор, который держит модели на своей инфраструктуре и отдаёт их через OpenAI-совместимый эндпоинт. В живом каталоге PlusVibe API сейчас пять моделей распознавания речи: две версии Whisper от OpenAI, компактный Nemotron ASR от NVIDIA, Universal-2 от AssemblyAI и ElevenLabs Scribe. Все тарифицируются за минуту входного аудио — не за токены и не за запросы. Цены в статье взяты из живого каталога (GET /api/catalog) и указаны на 4 сентября 2026 года; каталог помечает их как ориентировочные — итоговая сумма зависит от параметров запроса и уточняется по факту выполнения задачи.
Пять моделей распознавания в каталоге
Цены — ориентировочные, в рублях за одну минуту входного аудио. Каталог отдаёт тарифы всех пяти моделей с пометкой pricesAreEstimate: true: цена ориентировочная и зависит от параметров запроса, итоговая сумма списания формируется по факту выполнения задачи. На 4 сентября 2026 года:
whisper-large-v3-turbo
OpenAI Whisper large-v3-turbo
Массовая расшифровка: быстро и дёшево при близком к флагману качестве
0,03 ₽
nemotron-asr-multilingual
NVIDIA Nemotron 3.5 ASR Streaming Multilingual 0.6b
Компактная мультиязычная модель (0,6 млрд параметров) для поточных сценариев
0,03 ₽
whisper-large-v3
OpenAI Whisper large-v3
Флагман семейства Whisper: максимальное качество линии на сложном аудио
0,07 ₽
universal-2
AssemblyAI Universal-2
Русская речь: разделение говорящих, ключевые термины, автоопределение языка
0,36 ₽
speech-to-text
ElevenLabs Scribe
Дорогой флагман: диаризация, разметка звуковых событий, подсказки терминов
1,01 ₽
Коротко о каждой:
- whisper-large-v3-turbo — ускоренная версия Whisper large-v3: заметно быстрее при близком качестве и в 2,3 раза дешевле базовой версии. Рабочая лошадка для архивов, субтитров и всего, что считается сотнями часов.
- nemotron-asr-multilingual — компактная ASR-модель NVIDIA, рассчитанная на потоковые сценарии и быстрые ответы. Мультиязычная, стоит столько же, сколько turbo, — выбор для голосовых контуров, где важна скорость реакции и минимальная цена минуты.
- whisper-large-v3 — самая точная модель семейства Whisper в нашем каталоге. Берите её, когда запись сложная: шум, акценты, дальний микрофон, редкие термины — и разница в качестве оправдывает двукратную разницу в цене с turbo.
- universal-2 — модель AssemblyAI, заточенная под русскую речь: в нашем каталоге у неё русский контракт языка (
language_code=ruили автоопределение), поддерживает разделение по говорящим (speaker_labels) и подсказки ключевых терминов (keyterms_prompt) — то, что нужно для расшифровки звонков. - speech-to-text — ElevenLabs Scribe, самая дорогая позиция каталога. Умеет разделять говорящих (диаризация), размечать звуковые события (смех, аплодисменты, музыка) и принимать подсказки ключевых терминов. Это модель для интервью, созвонов и подкастов, где важна структура записи, а не только текст.
Страницы моделей с параметрами, примерами и актуальными ценами: whisper-large-v3-turbo, nemotron-asr-multilingual, whisper-large-v3, universal-2, speech-to-text.
Качество против скорости и цены: что выбрать под задачу
Честная оговорка сразу: собственных бенчмарков точности (WER) по этим пяти моделям мы не публикуем и чужие цифры выдавать за свои не будем — записи у всех разные, и правильный способ выбрать модель — прогнать через эндпоинт десяток своих реальных файлов. Ниже — логика выбора по сценариям, а не обещания процентов.
- Транскрибация звонков (колл-центр, продажи, поддержка). Ключевая потребность — кто что сказал: берите
universal-2илиspeech-to-text, обе умеют разделение по говорящим из коробки. Если бюджет жёсткий, у маршрутов Whisper и Nemotron диаризация тоже доступна в асинхронном режиме (opts.diarize) — при цене 0,03–0,07 ₽ за минуту это самый дешёвый способ получить реплики по спикерам. - Субтитры и расшифровка видеоархивов. Массовый объём —
whisper-large-v3-turbo: час аудио стоит примерно 1,80 ₽, и это минимальная цена каталога наравне с Nemotron. Для релизных субтитров, где ошибки заметны зрителю, прогоните контрольный образец наwhisper-large-v3— доплата 2,40 ₽ с часа может оказаться оправданной. - Голосовой бот. Здесь решают цена минуты и скорость ответа:
whisper-large-v3-turboилиnemotron-asr-multilingualпо 0,03 ₽ за минуту. Обе мультиязычные, обе быстро отвечают; на коротких репликах пользователей разница между ними практического смысла не имеет — выбирайте тестом на своих фразах. - Заметки со встреч. Нужна диаризация и устойчивость к переговорному шуму. Варианты:
speech-to-text(дороже всех, но со звуковыми событиями и подсказками терминов),universal-2(русская специализация) либо дешёвые маршруты сdiarize, если встреча не критичная.
Когда turbo достаточно почти всегда: черновики, поиск по аудиоархиву, внутренние инструменты, субтитры без релизного контроля, любые объёмы, где счёт идёт на сотни часов. Когда стоит доплатить за whisper-large-v3: сложный звук, редкие термины без подсказок, финальные материалы. Когда оправданы дорогие модели: нужен «кто говорит» и структура записи — звонки и встречи.
Русский язык: кто как работает
Все пять моделей понимают русскую речь, но контракты разные:
- Whisper large-v3 и turbo — мультиязычные модели: распознают десятки языков, язык можно указать явно полем
language(для русского —ru) или оставить автоопределение. Явное указание языка на русском аудио обычно повышает стабильность распознавания. - Nemotron ASR — мультиязычная модель, язык передаётся так же полем
language_code. - Universal-2 — в нашем каталоге работает по русскому контракту:
language_code=ruлибо автоопределение. Для русскоязычных звонков это профильный выбор. - ElevenLabs Scribe — мультиязычная модель, язык указывается полем
language_code.
Подключение: OpenAI-совместимый эндпоинт за 5 минут
Распознавание работает через тот же ключ sk-pv-…, что и чат-модели, и через привычный формат OpenAI: POST /v1/audio/transcriptions принимает multipart-форму с полями file (аудиофайл), model (идентификатор из каталога) и необязательным language. В ответ приходит JSON с полем text — расшифрованным текстом. Если ваш код уже работает с OpenAI SDK, меняется только base_url.
curl
curl https://plusvibeapi.ru/v1/audio/transcriptions \\
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \\
-F "model=whisper-large-v3-turbo" \\
-F "language=ru" \\
-F "file=@zvonok.mp3"
# → {"text":"…распознанный текст разговора…"}
Python (openai SDK)
from openai import OpenAI
client = OpenAI(
base_url="https://plusvibeapi.ru/v1",
api_key="sk-pv-ВАШ_КЛЮЧ",
)
with open("zvonok.mp3", "rb") as audio:
result = client.audio.transcriptions.create(
model="whisper-large-v3-turbo",
file=audio,
language="ru",
)
print(result.text)
Эндпоинт синхронный: сервер сам дожидается завершения расшифровки и возвращает готовый текст (ожидание занимает до двух минут). Для коротких файлов — звонков, голосовых, реплик бота — этого достаточно. Для длинных записей и пакетной обработки используйте асинхронный маршрут ниже.
Асинхронный маршрут для длинных записей и диаризации
Тот же набор моделей доступен через общий медиа-конвейер: POST /api/media/generate создаёт задачу, GET /api/media/jobs/{jobId} опрашивает её до готовности. Сюда аудио передаётся публичной HTTPS-ссылкой в opts.audio_url (или base64-строкой в opts.audio_base64) — удобно для потоков, где запись сначала попадает в объектное хранилище. Именно в этом режиме доступны расширенные параметры: diarize (разделение по говорящим у Whisper, Nemotron и Scribe), speaker_labels и keyterms_prompt у Universal-2, tag_audio_events и keyterms у Scribe.
curl -X POST https://plusvibeapi.ru/api/media/generate \\
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \\
-H "Content-Type: application/json" \\
-d '{
"model": "speech-to-text",
"prompt": "",
"opts": {
"audio_url": "https://example.com/sozvon.mp3",
"language_code": "ru",
"diarize": true
}
}'
# → {"ok":true,"jobId":"…","status":"processing"}
Статусы задачи: processing (ещё в работе), success (готово, списание по факту) и fail (ошибка без списания). Полный контракт и примеры — в документации по генерации медиа.
Форматы и ограничения файлов
- Форматы. Принимаются основные аудиоформаты: MP3, WAV, OGG, Opus, FLAC, M4A, AAC, WebM, а также MP4 и WebM-контейнеры с аудиодорожкой. Тип определяется по содержимому, поэтому переживать о точном MIME-заголовке не нужно.
- Размер. Синхронный эндпоинт принимает файлы до 50 МБ. У маршрутов Whisper и Nemotron действует более строгий внутренний лимит — 25 МБ на файл (примерно 26 минут записи в MP3 со 128 kbps).
- Длинные записи. Часовую лекцию в несжатом WAV лучше сжать в MP3 64–128 kbps — качество речи для распознавания при этом не страдает, а размер падает в десятки раз. Записи длиннее лимита режьте на части по паузам или отправляйте через асинхронный маршрут частями.
- Ссылки. Для
opts.audio_urlнужен публичный HTTPS-адрес, отдающий файл напрямую, без авторизации и переадресаций; закрытые и внутренние адреса отклоняются.
Сколько стоит час аудио: примерный расчёт
Логика тарификации простая: цена минуты умножается на длительность записи, а итоговое списание считается по фактической длительности аудио. Ниже — примерный расчёт по ориентировочным ценам из живого каталога на 4 сентября 2026 года: помня, что цена ориентировочная и зависит от параметров запроса, умножаем цену минуты на 60:
- whisper-large-v3-turbo: 60 × 0,03 ₽ = около 1,80 ₽ за час;
- nemotron-asr-multilingual: 60 × 0,03 ₽ = около 1,80 ₽ за час;
- whisper-large-v3: 60 × 0,07 ₽ = около 4,20 ₽ за час;
- universal-2: 60 × 0,36 ₽ = около 21,60 ₽ за час;
- speech-to-text: 60 × 1,01 ₽ = около 60,60 ₽ за час.
Пример на реальный объём — тоже ориентировочный. Колл-центр обрабатывает 500 часов звонков в месяц:
- на
whisper-large-v3-turbo— 500 × 1,80 ₽ ≈ 900 ₽ в месяц; - на
whisper-large-v3— 500 × 4,20 ₽ ≈ 2 100 ₽; - на
universal-2(с разделением по говорящим) — 500 × 21,60 ₽ ≈ 10 800 ₽; - на
speech-to-text— 500 × 60,60 ₽ ≈ 30 300 ₽.
Разброс между самой дешёвой и самой дорогой моделью — более чем в 33 раза, поэтому модель стоит выбирать под задачу, а не «на всякий случай самую лучшую». Ошибка в обратную сторону тоже недорога: расшифровать тот же час на модели классом выше стоит от 2,40 ₽ доплаты. Актуальный прайс по всем моделям всегда виден на странице Модели и цены — цены в статье снимались оттуда, они ориентировочные и могут меняться.
Оплата и документы для юрлиц
- Рубли. Баланс пополняется российскими картами и через СБП — без валютных счетов и зарубежных карт. Списание идёт в рублях по факту каждой расшифровки.
- Документы. Работаем с юрлицами и ИП: счета и закрывающие документы по фактически потреблённым услугам за месяц направляем через ЭДО. Мы — ИП на УСН, поэтому в документах указывается «Без НДС».
- Постоплата. Для организаций возможна договорная отсрочка платежа по фактическому потреблению — соглашение по ст. 823 ГК РФ: старт с предоплаты, первый лимит до 5 000 ₽, после двух вовремя оплаченных периодов — до 10 000 ₽, дальше индивидуальные условия. Подробности — в статье о постоплате API для юрлиц.
Честные ограничения
- Файлы, а не живой поток. Интерфейс принимает готовый аудиофайл (или ссылку на него); стриминга микрофона в реальном времени нет. Для голосового бота реплику нужно сначала записать — при ценах 0,03 ₽ за минуту и быстром ответе это рабочая схема, но архитектурно закладывайте буфер.
- Синхронный эндпоинт ждёт до двух минут. Для длинных записей используйте асинхронный маршрут с опросом задачи.
- Цены ориентировочные. Каталог отдаёт тарифы всех пяти моделей с пометкой
pricesAreEstimate: true: цена ориентировочная и зависит от параметров запроса. Оценка строится по длительности аудио, итоговая сумма списания формируется после выполнения задачи по фактической длительности. Ошибка при расшифровке ничего не стоит. - Бенчмарков не обещаем. Мы не публикуем собственных цифр точности по этим моделям: выбор между соседними по цене вариантами (например, turbo против Nemotron) делайте прогоном своих записей — это занимает десять минут и стоит копейки.
Итог
Распознавание речи через API в России — это пять моделей с оплатой за минуту аудио: от 0,03 ₽ за минуту у whisper-large-v3-turbo и nemotron-asr-multilingual до 1,01 ₽ у ElevenLabs Scribe с диаризацией и разметкой звуковых событий. Час расшифровки по ориентировочным ценам — примерно от 1,80 ₽ до 60,60 ₽, подключение — одна строка base_url в уже знакомом OpenAI-формате, оплата в рублях с документами через ЭДО и постоплатой для юрлиц. Если в продукте есть звонки, видео или голос — начните с теста своих записей на turbo: это дешевле чашки кофе. Общий обзор тарифов всех моделей — в сравнении LLM API в России, а про текстовую часть конвейера (суммаризация расшифровок, ответы бота) — в статье об OpenAI API в России.
Зарегистрируйтесь бесплатно и расшифруйте первый аудиофайл через 5 минут.



