·10 мин. чтения

Распознавание речи через API в России: 5 моделей, цены за минуту и подключение без VPN

Распознавание речи через API в России: 5 моделей (Whisper large-v3 и turbo, Nemotron ASR, Universal-2, ElevenLabs Scribe) с оплатой в рублях — цены за минуту аудио на 04.09.2026, форматы, расчёт стоимости часа и пример запроса.

Распознавание речи через API в России: 5 моделей, цены за минуту и подключение без VPN

Распознавание речи через API в России: 5 моделей, цены за минуту и подключение без VPN

Голосовых данных у продуктов становится больше с каждым месяцем: звонки в поддержку и продажи, созвоны команд, видео и подкасты, голосовые сообщения. Для разработчика это четыре типовые задачи: транскрибация звонков для CRM и анализа разговоров, субтитры к видео, голосовой бот, который понимает речь на слух, и заметки со встреч с разделением по говорящим. Все они упираются в один и тот же вопрос: какой API распознавания речи взять, если ты в России, платишь в рублях и не хочешь строить продакшен на VPN.

Прямой путь к западным платформам закрыт практикой: американские сервисы не работают с российскими IP и картами, не дают закрывающих документов, а обходные маршруты нестабильны. Рабочее решение — российский агрегатор, который держит модели на своей инфраструктуре и отдаёт их через OpenAI-совместимый эндпоинт. В живом каталоге PlusVibe API сейчас пять моделей распознавания речи: две версии Whisper от OpenAI, компактный Nemotron ASR от NVIDIA, Universal-2 от AssemblyAI и ElevenLabs Scribe. Все тарифицируются за минуту входного аудио — не за токены и не за запросы. Цены в статье взяты из живого каталога (GET /api/catalog) и указаны на 4 сентября 2026 года; каталог помечает их как ориентировочные — итоговая сумма зависит от параметров запроса и уточняется по факту выполнения задачи.

Пять моделей распознавания в каталоге

Цены — ориентировочные, в рублях за одну минуту входного аудио. Каталог отдаёт тарифы всех пяти моделей с пометкой pricesAreEstimate: true: цена ориентировочная и зависит от параметров запроса, итоговая сумма списания формируется по факту выполнения задачи. На 4 сентября 2026 года:

ИдентификаторМодельПрофильОриентировочная цена за минуту аудио whisper-large-v3-turbo OpenAI Whisper large-v3-turbo Массовая расшифровка: быстро и дёшево при близком к флагману качестве 0,03 ₽ nemotron-asr-multilingual NVIDIA Nemotron 3.5 ASR Streaming Multilingual 0.6b Компактная мультиязычная модель (0,6 млрд параметров) для поточных сценариев 0,03 ₽ whisper-large-v3 OpenAI Whisper large-v3 Флагман семейства Whisper: максимальное качество линии на сложном аудио 0,07 ₽ universal-2 AssemblyAI Universal-2 Русская речь: разделение говорящих, ключевые термины, автоопределение языка 0,36 ₽ speech-to-text ElevenLabs Scribe Дорогой флагман: диаризация, разметка звуковых событий, подсказки терминов 1,01 ₽

Коротко о каждой:

  • whisper-large-v3-turbo — ускоренная версия Whisper large-v3: заметно быстрее при близком качестве и в 2,3 раза дешевле базовой версии. Рабочая лошадка для архивов, субтитров и всего, что считается сотнями часов.
  • nemotron-asr-multilingual — компактная ASR-модель NVIDIA, рассчитанная на потоковые сценарии и быстрые ответы. Мультиязычная, стоит столько же, сколько turbo, — выбор для голосовых контуров, где важна скорость реакции и минимальная цена минуты.
  • whisper-large-v3 — самая точная модель семейства Whisper в нашем каталоге. Берите её, когда запись сложная: шум, акценты, дальний микрофон, редкие термины — и разница в качестве оправдывает двукратную разницу в цене с turbo.
  • universal-2 — модель AssemblyAI, заточенная под русскую речь: в нашем каталоге у неё русский контракт языка (language_code=ru или автоопределение), поддерживает разделение по говорящим (speaker_labels) и подсказки ключевых терминов (keyterms_prompt) — то, что нужно для расшифровки звонков.
  • speech-to-text — ElevenLabs Scribe, самая дорогая позиция каталога. Умеет разделять говорящих (диаризация), размечать звуковые события (смех, аплодисменты, музыка) и принимать подсказки ключевых терминов. Это модель для интервью, созвонов и подкастов, где важна структура записи, а не только текст.

Страницы моделей с параметрами, примерами и актуальными ценами: whisper-large-v3-turbo, nemotron-asr-multilingual, whisper-large-v3, universal-2, speech-to-text.

Качество против скорости и цены: что выбрать под задачу

Честная оговорка сразу: собственных бенчмарков точности (WER) по этим пяти моделям мы не публикуем и чужие цифры выдавать за свои не будем — записи у всех разные, и правильный способ выбрать модель — прогнать через эндпоинт десяток своих реальных файлов. Ниже — логика выбора по сценариям, а не обещания процентов.

  • Транскрибация звонков (колл-центр, продажи, поддержка). Ключевая потребность — кто что сказал: берите universal-2 или speech-to-text, обе умеют разделение по говорящим из коробки. Если бюджет жёсткий, у маршрутов Whisper и Nemotron диаризация тоже доступна в асинхронном режиме (opts.diarize) — при цене 0,03–0,07 ₽ за минуту это самый дешёвый способ получить реплики по спикерам.
  • Субтитры и расшифровка видеоархивов. Массовый объём — whisper-large-v3-turbo: час аудио стоит примерно 1,80 ₽, и это минимальная цена каталога наравне с Nemotron. Для релизных субтитров, где ошибки заметны зрителю, прогоните контрольный образец на whisper-large-v3 — доплата 2,40 ₽ с часа может оказаться оправданной.
  • Голосовой бот. Здесь решают цена минуты и скорость ответа: whisper-large-v3-turbo или nemotron-asr-multilingual по 0,03 ₽ за минуту. Обе мультиязычные, обе быстро отвечают; на коротких репликах пользователей разница между ними практического смысла не имеет — выбирайте тестом на своих фразах.
  • Заметки со встреч. Нужна диаризация и устойчивость к переговорному шуму. Варианты: speech-to-text (дороже всех, но со звуковыми событиями и подсказками терминов), universal-2 (русская специализация) либо дешёвые маршруты с diarize, если встреча не критичная.

Когда turbo достаточно почти всегда: черновики, поиск по аудиоархиву, внутренние инструменты, субтитры без релизного контроля, любые объёмы, где счёт идёт на сотни часов. Когда стоит доплатить за whisper-large-v3: сложный звук, редкие термины без подсказок, финальные материалы. Когда оправданы дорогие модели: нужен «кто говорит» и структура записи — звонки и встречи.

Русский язык: кто как работает

Все пять моделей понимают русскую речь, но контракты разные:

  • Whisper large-v3 и turbo — мультиязычные модели: распознают десятки языков, язык можно указать явно полем language (для русского — ru) или оставить автоопределение. Явное указание языка на русском аудио обычно повышает стабильность распознавания.
  • Nemotron ASR — мультиязычная модель, язык передаётся так же полем language_code.
  • Universal-2 — в нашем каталоге работает по русскому контракту: language_code=ru либо автоопределение. Для русскоязычных звонков это профильный выбор.
  • ElevenLabs Scribe — мультиязычная модель, язык указывается полем language_code.

Подключение: OpenAI-совместимый эндпоинт за 5 минут

Распознавание работает через тот же ключ sk-pv-…, что и чат-модели, и через привычный формат OpenAI: POST /v1/audio/transcriptions принимает multipart-форму с полями file (аудиофайл), model (идентификатор из каталога) и необязательным language. В ответ приходит JSON с полем text — расшифрованным текстом. Если ваш код уже работает с OpenAI SDK, меняется только base_url.

curl

curl https://plusvibeapi.ru/v1/audio/transcriptions \\
  -H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \\
  -F "model=whisper-large-v3-turbo" \\
  -F "language=ru" \\
  -F "file=@zvonok.mp3"
# → {"text":"…распознанный текст разговора…"}

Python (openai SDK)

from openai import OpenAI

client = OpenAI(
    base_url="https://plusvibeapi.ru/v1",
    api_key="sk-pv-ВАШ_КЛЮЧ",
)

with open("zvonok.mp3", "rb") as audio:
    result = client.audio.transcriptions.create(
        model="whisper-large-v3-turbo",
        file=audio,
        language="ru",
    )

print(result.text)

Эндпоинт синхронный: сервер сам дожидается завершения расшифровки и возвращает готовый текст (ожидание занимает до двух минут). Для коротких файлов — звонков, голосовых, реплик бота — этого достаточно. Для длинных записей и пакетной обработки используйте асинхронный маршрут ниже.

Асинхронный маршрут для длинных записей и диаризации

Тот же набор моделей доступен через общий медиа-конвейер: POST /api/media/generate создаёт задачу, GET /api/media/jobs/{jobId} опрашивает её до готовности. Сюда аудио передаётся публичной HTTPS-ссылкой в opts.audio_url (или base64-строкой в opts.audio_base64) — удобно для потоков, где запись сначала попадает в объектное хранилище. Именно в этом режиме доступны расширенные параметры: diarize (разделение по говорящим у Whisper, Nemotron и Scribe), speaker_labels и keyterms_prompt у Universal-2, tag_audio_events и keyterms у Scribe.

curl -X POST https://plusvibeapi.ru/api/media/generate \\
  -H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "speech-to-text",
    "prompt": "",
    "opts": {
      "audio_url": "https://example.com/sozvon.mp3",
      "language_code": "ru",
      "diarize": true
    }
  }'
# → {"ok":true,"jobId":"…","status":"processing"}

Статусы задачи: processing (ещё в работе), success (готово, списание по факту) и fail (ошибка без списания). Полный контракт и примеры — в документации по генерации медиа.

Форматы и ограничения файлов

  • Форматы. Принимаются основные аудиоформаты: MP3, WAV, OGG, Opus, FLAC, M4A, AAC, WebM, а также MP4 и WebM-контейнеры с аудиодорожкой. Тип определяется по содержимому, поэтому переживать о точном MIME-заголовке не нужно.
  • Размер. Синхронный эндпоинт принимает файлы до 50 МБ. У маршрутов Whisper и Nemotron действует более строгий внутренний лимит — 25 МБ на файл (примерно 26 минут записи в MP3 со 128 kbps).
  • Длинные записи. Часовую лекцию в несжатом WAV лучше сжать в MP3 64–128 kbps — качество речи для распознавания при этом не страдает, а размер падает в десятки раз. Записи длиннее лимита режьте на части по паузам или отправляйте через асинхронный маршрут частями.
  • Ссылки. Для opts.audio_url нужен публичный HTTPS-адрес, отдающий файл напрямую, без авторизации и переадресаций; закрытые и внутренние адреса отклоняются.

Сколько стоит час аудио: примерный расчёт

Логика тарификации простая: цена минуты умножается на длительность записи, а итоговое списание считается по фактической длительности аудио. Ниже — примерный расчёт по ориентировочным ценам из живого каталога на 4 сентября 2026 года: помня, что цена ориентировочная и зависит от параметров запроса, умножаем цену минуты на 60:

  • whisper-large-v3-turbo: 60 × 0,03 ₽ = около 1,80 ₽ за час;
  • nemotron-asr-multilingual: 60 × 0,03 ₽ = около 1,80 ₽ за час;
  • whisper-large-v3: 60 × 0,07 ₽ = около 4,20 ₽ за час;
  • universal-2: 60 × 0,36 ₽ = около 21,60 ₽ за час;
  • speech-to-text: 60 × 1,01 ₽ = около 60,60 ₽ за час.

Пример на реальный объём — тоже ориентировочный. Колл-центр обрабатывает 500 часов звонков в месяц:

  • на whisper-large-v3-turbo — 500 × 1,80 ₽ ≈ 900 ₽ в месяц;
  • на whisper-large-v3 — 500 × 4,20 ₽ ≈ 2 100 ₽;
  • на universal-2 (с разделением по говорящим) — 500 × 21,60 ₽ ≈ 10 800 ₽;
  • на speech-to-text — 500 × 60,60 ₽ ≈ 30 300 ₽.

Разброс между самой дешёвой и самой дорогой моделью — более чем в 33 раза, поэтому модель стоит выбирать под задачу, а не «на всякий случай самую лучшую». Ошибка в обратную сторону тоже недорога: расшифровать тот же час на модели классом выше стоит от 2,40 ₽ доплаты. Актуальный прайс по всем моделям всегда виден на странице Модели и цены — цены в статье снимались оттуда, они ориентировочные и могут меняться.

Оплата и документы для юрлиц

  • Рубли. Баланс пополняется российскими картами и через СБП — без валютных счетов и зарубежных карт. Списание идёт в рублях по факту каждой расшифровки.
  • Документы. Работаем с юрлицами и ИП: счета и закрывающие документы по фактически потреблённым услугам за месяц направляем через ЭДО. Мы — ИП на УСН, поэтому в документах указывается «Без НДС».
  • Постоплата. Для организаций возможна договорная отсрочка платежа по фактическому потреблению — соглашение по ст. 823 ГК РФ: старт с предоплаты, первый лимит до 5 000 ₽, после двух вовремя оплаченных периодов — до 10 000 ₽, дальше индивидуальные условия. Подробности — в статье о постоплате API для юрлиц.

Честные ограничения

  • Файлы, а не живой поток. Интерфейс принимает готовый аудиофайл (или ссылку на него); стриминга микрофона в реальном времени нет. Для голосового бота реплику нужно сначала записать — при ценах 0,03 ₽ за минуту и быстром ответе это рабочая схема, но архитектурно закладывайте буфер.
  • Синхронный эндпоинт ждёт до двух минут. Для длинных записей используйте асинхронный маршрут с опросом задачи.
  • Цены ориентировочные. Каталог отдаёт тарифы всех пяти моделей с пометкой pricesAreEstimate: true: цена ориентировочная и зависит от параметров запроса. Оценка строится по длительности аудио, итоговая сумма списания формируется после выполнения задачи по фактической длительности. Ошибка при расшифровке ничего не стоит.
  • Бенчмарков не обещаем. Мы не публикуем собственных цифр точности по этим моделям: выбор между соседними по цене вариантами (например, turbo против Nemotron) делайте прогоном своих записей — это занимает десять минут и стоит копейки.

Итог

Распознавание речи через API в России — это пять моделей с оплатой за минуту аудио: от 0,03 ₽ за минуту у whisper-large-v3-turbo и nemotron-asr-multilingual до 1,01 ₽ у ElevenLabs Scribe с диаризацией и разметкой звуковых событий. Час расшифровки по ориентировочным ценам — примерно от 1,80 ₽ до 60,60 ₽, подключение — одна строка base_url в уже знакомом OpenAI-формате, оплата в рублях с документами через ЭДО и постоплатой для юрлиц. Если в продукте есть звонки, видео или голос — начните с теста своих записей на turbo: это дешевле чашки кофе. Общий обзор тарифов всех моделей — в сравнении LLM API в России, а про текстовую часть конвейера (суммаризация расшифровок, ответы бота) — в статье об OpenAI API в России.

Зарегистрируйтесь бесплатно и расшифруйте первый аудиофайл через 5 минут.

распознавание речи apiwhisper api в россиитранскрибация аудио apispeech to text на русскомтранскрибация звонков apiраспознавание речи api ценаподключить whisper api оплата рублями

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

Распознавание речи через API в России: 5 моделей, цены за минуту и подключение без VPN | PlusVibe API