·5 мин. чтения

TTS API в России: озвучка текста нейросетью

Синтез речи по API из России: шесть TTS-моделей, русский язык, выбор голоса, OpenAI-совместимый /v1/audio/speech и цены в рублях за 1000 символов.

TTS API в России: озвучка текста нейросетью

Синтез речи (TTS, text-to-speech) превращает текст в аудио: озвучка статей и уроков, голос для бота, диктор для видео, автоматические звонки и уведомления. Через PlusVibe API TTS-модели доступны из России по одному ключу, с оплатой в рублях. Разберём, какие модели есть в каталоге, чем они отличаются, как подключить их за пять минут и сколько стоит озвучка.

Какие TTS-модели доступны

В каталоге шесть моделей синтеза речи. Они сильно отличаются по языкам, голосам и цене, поэтому выбирать стоит под задачу.

  • tts — универсальная модель с выбором движка: ElevenLabs Turbo 2.5 и Multilingual v2, MiniMax Speech 2.8 Turbo и HD, Qwen3-TTS и Gemini 3.1 Flash TTS. Поддерживает русский язык (language_code: "ru"), выбор голоса, настройки стабильности и скорости, а также таймкоды (timestamps: true). Основной выбор для русской озвучки.
  • gemini-tts — синтез речи Google с 30 голосами и управлением подачей: стиль (например, диктор новостей, шёпот, эмпатичный или рекламный тон), темп и акцент. Умеет диалоги из нескольких реплик разными голосами.
  • elevenlabs-dialogue — ElevenLabs V3 для многоголосых диалогов: вы передаёте массив реплик, у каждой свой текст и свой голос. Подходит для подкастов, аудиоспектаклей, обучающих сценок.
  • chatterbox-tts — мультиязычная модель Resemble AI: 23 языка, включая русский. Рассчитана на короткие фрагменты — до 300 символов на запрос.
  • kokoro-tts — лёгкая и быстрая модель только для американского английского, с двумя десятками голосов.
  • chatterbox-turbo — самый дешёвый вариант в каталоге. Хорош для черновиков и массовой генерации, но качество и произношение на вашем тексте стоит проверить до запуска.

Как выбрать

  • Русская озвучка статей, курсов, роликов — tts: переберите движки на своём тексте и выберите тот, что звучит естественнее.
  • Нужна интонация (реклама, новости, мягкий тон поддержки) — gemini-tts со стилем и темпом.
  • Диалог двух и более персонажей — elevenlabs-dialogue или диалоговый режим gemini-tts.
  • Английский продукт, минимальный бюджет — kokoro-tts.
  • Короткие фразы на разных языках — chatterbox-tts.

Подключение за пять минут: OpenAI-совместимый эндпоинт

Если у вас уже есть код под OpenAI, менять почти ничего не нужно. POST /v1/audio/speech принимает тот же JSON и сразу возвращает аудиофайл. Работают модели tts, gemini-tts, chatterbox-tts, kokoro-tts и chatterbox-turbo; подробности — в разделе документации «Аудио».

curl https://plusvibeapi.ru/v1/audio/speech \
  -H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts",
    "input": "Добрый день! Ваш заказ собран и будет у вас завтра до обеда.",
    "response_format": "mp3"
  }' \
  --output speech.mp3

То же самое на Python через официальный SDK OpenAI — достаточно поменять base_url:

from openai import OpenAI

client = OpenAI(api_key="sk-pv-ВАШ_КЛЮЧ", base_url="https://plusvibeapi.ru/v1")

with client.audio.speech.with_streaming_response.create(
    model="gemini-tts",
    voice="Kore",
    input="Здравствуйте! Это тестовая озвучка.",
    response_format="mp3",
) as response:
    response.stream_to_file("speech.mp3")

Что поддерживается:

  • response_format — mp3, opus, aac, flac, wav или pcm. Если модель отдаёт другой формат, сервис сам перекодирует аудио.
  • speed — от 0,25 до 4, как у OpenAI; у конкретной модели диапазон может быть уже.
  • voice — имя голоса выбранной модели (списки голосов — на страницах моделей). Если не указать, берётся голос по умолчанию.

Полный контроль: асинхронный /api/media/generate

Все параметры моделей — движок, язык, стиль, таймкоды, многоголосый диалог — доступны через общий медиа-эндпоинт. Он работает как очередь: вы создаёте задачу и опрашиваете статус (схема описана в разделе «Генерация медиа»).

curl -X POST https://plusvibeapi.ru/api/media/generate \
  -H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts",
    "prompt": "Сегодня расскажем, как подключить синтез речи за пять минут.",
    "opts": { "engine": "minimax-hd", "language_code": "ru" }
  }'
# → HTTP 202: {"ok":true,"jobId":"...","status":"processing"}
# затем GET /api/media/jobs/JOB_ID до status: "success" → resultUrls

Для elevenlabs-dialogue реплики передаются массивом dialogue в opts — у каждой свой текст и свой голос. Точную схему полей для каждой модели показывает каталог медиа-моделей.

Попробовать голоса без кода можно в Нейростудии в личном кабинете (/dashboard/studio): текст, движок, голос — и сразу прослушивание.

Сколько стоит озвучка

Синтез речи тарифицируется по длине текста: цены ниже — за 1000 символов, итоговая сумма пропорциональна вашему тексту. Цены ориентировочные, сверены с каталогом 25 сентября 2026 года.

МодельЦена за 1000 символов chatterbox-turboот 0,13 ₽ chatterbox-ttsот 3 ₽ kokoro-ttsот 3 ₽ gemini-ttsот 5,30 ₽ ttsот 8 ₽, зависит от движка elevenlabs-dialogueот 12,62 ₽

У модели tts цена зависит от выбранного движка: калькулятор на её странице покажет сумму для каждого варианта до запуска. Если задача завершилась ошибкой, деньги не списываются.

Где пригодится TTS

  • Озвучка контента — статьи в аудиоформате, уроки, инструкции, описания товаров.
  • Голосовые боты и IVR — связка «распознавание речи → языковая модель → синтез». Для первой части — статья «Распознавание речи по API в России».
  • Дикторский текст для видео — озвучку можно сразу превратить в говорящего персонажа: у Kling AI Avatar и Wan Speech-to-Video на вход подаётся фото и аудио. Подробнее — в статьях про Kling API и Wan API.
  • Уведомления и доступность — голосовые подсказки в приложении, озвучка интерфейса для людей со слабым зрением.

Нужна не речь, а музыка или песня — это другая задача и другая модель: см. «Suno API в России».

Оплата и документы

Один баланс в рублях на все модели — текстовые, медиа и речевые. Юрлица и ИП могут платить по счёту и получать закрывающие документы; условия — в договоре.

Честные ограничения

  • Качество зависит от текста. Цифры, аббревиатуры и ударения модели читают по-разному. Для продакшена проверьте произношение на своих типовых фразах и при необходимости запишите сложные слова так, как они должны звучать.
  • Языки. kokoro-tts работает только с английским, у chatterbox-tts есть ограничение на длину фрагмента. Для русского начинайте с tts и gemini-tts.
  • Голоса и права. Используйте голоса из каталога моделей. Условия использования результатов устанавливает разработчик модели.

Итог

Для русской озвучки начните с tts и сравните движки на своём тексте; для живой интонации — gemini-tts; для диалогов — elevenlabs-dialogue. Подключение — через OpenAI-совместимый /v1/audio/speech или через медиа-API с полным набором параметров. Ключ и Нейростудия — в личном кабинете.

tts apiозвучка текста apiсинтез речи apitts api русскийtext to speech api россияозвучка текста нейросетьюelevenlabs api россияopenai audio speech api

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

TTS API в России: озвучка текста нейросетью | PlusVibe API