Транскрибация аудио

Распознавание аудио через POST /v1/audio/transcriptions в формате OpenAI: модели Whisper, NVIDIA и Speech-to-text, лимит файла 50 MB, примеры curl и Python. Текущие цены — в каталоге моделей.

Аудио в формате OpenAI

Для синтеза речи используйте JSON-формат OpenAI. Ответ содержит аудиобайты; по умолчанию возвращается MP3.

POSThttps://plusvibeapi.ru/v1/audio/speech
curl https://plusvibeapi.ru/v1/audio/speech \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "chatterbox-turbo",
    "input": "Привет от PlusVibe",
    "voice": "default",
    "response_format": "mp3",
    "speed": 1
  }' \
  --output speech.mp3

Доступны модели tts, gemini-tts, chatterbox-tts, kokoro-tts и chatterbox-turbo. Параметры response_format (mp3, opus, aac, flac, wav, pcm) и speed принимаются в формате OpenAI; ограничения конкретной модели указаны на её странице.

Распознавание в формате OpenAI

Для файла используйте multipart-запрос с полями file и model. Максимальный размер файла — 50 MB. Ответ имеет вид { text: "..." }.

POSThttps://plusvibeapi.ru/v1/audio/transcriptions
curl https://plusvibeapi.ru/v1/audio/transcriptions \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -F file=@sample.wav \
  -F model=whisper-large-v3 \
  -F language=ru
# → {"text":"..."}

Модели speech-to-text, whisper-large-v3-turbo, nemotron-asr-multilingual и whisper-large-v3. Все тарифицируются по длительности аудио; актуальные цены — в каталоге аудиомоделей. Размер — от 1 байта до 50 MB. Расширение файла отдельно не проверяется; ответ всегда JSON с полем text, параметр response_format не поддерживается.

Отдельный маршрут /api/transcribe принимает публичный audio_url, работает асинхронно и доступен только если оператор включил TRANSCRIBE_ENABLED; иначе возвращает 503.

Старое распознавание по URL

Асинхронная транскрибация аудио по публичному URL. Создаёте задачу и опрашиваете результат по нашему id.

POSThttps://plusvibeapi.ru/api/transcribe
GEThttps://plusvibeapi.ru/api/transcribe/{id}

Параметры создания

ПараметрТипОписание
audio_urlобяз.string (URL)Публичная ссылка на аудиофайл.
languagestringКод языка, например ru, en (2–10 символов). Необязательно — автоопределение.
redact_piibooleanРедакция персональных данных. Включена по умолчанию (соответствие 152-ФЗ); отключается только явным redact_pii: false.

Создание и опрос

Создание возвращает 202 с { id, status: "processing" }. Опрашивайте GET /api/transcribe/{id} до статуса success (или fail); тогда в ответе будет text, durationSec, priceRub.

# 1. создать задачу транскрибации (аудио по публичному URL)
curl https://plusvibeapi.ru/api/transcribe \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "audio_url": "https://example.com/audio.mp3",
    "language": "ru",
    "redact_pii": true
  }'
# → {"id":"...","status":"processing"}
Цена — 1.5₽ за минуту (минимум 1 минута, округление вверх). Списание происходит один раз, при завершении задачи. Редакция ПДн включена по умолчанию и не удорожает тариф.
Транскрибация аудио API — Speech-to-text, Whisper | PlusVibe API