Синтез речи (TTS, text-to-speech) превращает текст в аудио: озвучка статей и уроков, голос для бота, диктор для видео, автоматические звонки и уведомления. Через PlusVibe API TTS-модели доступны из России по одному ключу, с оплатой в рублях. Разберём, какие модели есть в каталоге, чем они отличаются, как подключить их за пять минут и сколько стоит озвучка.
Какие TTS-модели доступны
В каталоге шесть моделей синтеза речи. Они сильно отличаются по языкам, голосам и цене, поэтому выбирать стоит под задачу.
- tts — универсальная модель с выбором движка: ElevenLabs Turbo 2.5 и Multilingual v2, MiniMax Speech 2.8 Turbo и HD, Qwen3-TTS и Gemini 3.1 Flash TTS. Поддерживает русский язык (
language_code: "ru"), выбор голоса, настройки стабильности и скорости, а также таймкоды (timestamps: true). Основной выбор для русской озвучки. - gemini-tts — синтез речи Google с 30 голосами и управлением подачей: стиль (например, диктор новостей, шёпот, эмпатичный или рекламный тон), темп и акцент. Умеет диалоги из нескольких реплик разными голосами.
- elevenlabs-dialogue — ElevenLabs V3 для многоголосых диалогов: вы передаёте массив реплик, у каждой свой текст и свой голос. Подходит для подкастов, аудиоспектаклей, обучающих сценок.
- chatterbox-tts — мультиязычная модель Resemble AI: 23 языка, включая русский. Рассчитана на короткие фрагменты — до 300 символов на запрос.
- kokoro-tts — лёгкая и быстрая модель только для американского английского, с двумя десятками голосов.
- chatterbox-turbo — самый дешёвый вариант в каталоге. Хорош для черновиков и массовой генерации, но качество и произношение на вашем тексте стоит проверить до запуска.
Как выбрать
- Русская озвучка статей, курсов, роликов —
tts: переберите движки на своём тексте и выберите тот, что звучит естественнее. - Нужна интонация (реклама, новости, мягкий тон поддержки) —
gemini-ttsсо стилем и темпом. - Диалог двух и более персонажей —
elevenlabs-dialogueили диалоговый режимgemini-tts. - Английский продукт, минимальный бюджет —
kokoro-tts. - Короткие фразы на разных языках —
chatterbox-tts.
Подключение за пять минут: OpenAI-совместимый эндпоинт
Если у вас уже есть код под OpenAI, менять почти ничего не нужно. POST /v1/audio/speech принимает тот же JSON и сразу возвращает аудиофайл. Работают модели tts, gemini-tts, chatterbox-tts, kokoro-tts и chatterbox-turbo; подробности — в разделе документации «Аудио».
curl https://plusvibeapi.ru/v1/audio/speech \
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "tts",
"input": "Добрый день! Ваш заказ собран и будет у вас завтра до обеда.",
"response_format": "mp3"
}' \
--output speech.mp3
То же самое на Python через официальный SDK OpenAI — достаточно поменять base_url:
from openai import OpenAI
client = OpenAI(api_key="sk-pv-ВАШ_КЛЮЧ", base_url="https://plusvibeapi.ru/v1")
with client.audio.speech.with_streaming_response.create(
model="gemini-tts",
voice="Kore",
input="Здравствуйте! Это тестовая озвучка.",
response_format="mp3",
) as response:
response.stream_to_file("speech.mp3")
Что поддерживается:
response_format—mp3,opus,aac,flac,wavилиpcm. Если модель отдаёт другой формат, сервис сам перекодирует аудио.speed— от 0,25 до 4, как у OpenAI; у конкретной модели диапазон может быть уже.voice— имя голоса выбранной модели (списки голосов — на страницах моделей). Если не указать, берётся голос по умолчанию.
Полный контроль: асинхронный /api/media/generate
Все параметры моделей — движок, язык, стиль, таймкоды, многоголосый диалог — доступны через общий медиа-эндпоинт. Он работает как очередь: вы создаёте задачу и опрашиваете статус (схема описана в разделе «Генерация медиа»).
curl -X POST https://plusvibeapi.ru/api/media/generate \
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \
-H "Content-Type: application/json" \
-d '{
"model": "tts",
"prompt": "Сегодня расскажем, как подключить синтез речи за пять минут.",
"opts": { "engine": "minimax-hd", "language_code": "ru" }
}'
# → HTTP 202: {"ok":true,"jobId":"...","status":"processing"}
# затем GET /api/media/jobs/JOB_ID до status: "success" → resultUrls
Для elevenlabs-dialogue реплики передаются массивом dialogue в opts — у каждой свой текст и свой голос. Точную схему полей для каждой модели показывает каталог медиа-моделей.
Попробовать голоса без кода можно в Нейростудии в личном кабинете (/dashboard/studio): текст, движок, голос — и сразу прослушивание.
Сколько стоит озвучка
Синтез речи тарифицируется по длине текста: цены ниже — за 1000 символов, итоговая сумма пропорциональна вашему тексту. Цены ориентировочные, сверены с каталогом 25 сентября 2026 года.
МодельЦена за 1000 символов chatterbox-turboот 0,13 ₽ chatterbox-ttsот 3 ₽ kokoro-ttsот 3 ₽ gemini-ttsот 5,30 ₽ ttsот 8 ₽, зависит от движка elevenlabs-dialogueот 12,62 ₽У модели tts цена зависит от выбранного движка: калькулятор на её странице покажет сумму для каждого варианта до запуска. Если задача завершилась ошибкой, деньги не списываются.
Где пригодится TTS
- Озвучка контента — статьи в аудиоформате, уроки, инструкции, описания товаров.
- Голосовые боты и IVR — связка «распознавание речи → языковая модель → синтез». Для первой части — статья «Распознавание речи по API в России».
- Дикторский текст для видео — озвучку можно сразу превратить в говорящего персонажа: у Kling AI Avatar и Wan Speech-to-Video на вход подаётся фото и аудио. Подробнее — в статьях про Kling API и Wan API.
- Уведомления и доступность — голосовые подсказки в приложении, озвучка интерфейса для людей со слабым зрением.
Нужна не речь, а музыка или песня — это другая задача и другая модель: см. «Suno API в России».
Оплата и документы
Один баланс в рублях на все модели — текстовые, медиа и речевые. Юрлица и ИП могут платить по счёту и получать закрывающие документы; условия — в договоре.
Честные ограничения
- Качество зависит от текста. Цифры, аббревиатуры и ударения модели читают по-разному. Для продакшена проверьте произношение на своих типовых фразах и при необходимости запишите сложные слова так, как они должны звучать.
- Языки.
kokoro-ttsработает только с английским, уchatterbox-ttsесть ограничение на длину фрагмента. Для русского начинайте сttsиgemini-tts. - Голоса и права. Используйте голоса из каталога моделей. Условия использования результатов устанавливает разработчик модели.
Итог
Для русской озвучки начните с tts и сравните движки на своём тексте; для живой интонации — gemini-tts; для диалогов — elevenlabs-dialogue. Подключение — через OpenAI-совместимый /v1/audio/speech или через медиа-API с полным набором параметров. Ключ и Нейростудия — в личном кабинете.



