Синтез речи
29 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.
Синтез · Транскрипция · Realtime · Интеллект
Облачный API для работы с речью: нейронный синтез и клонирование голоса, расшифровка аудио в текст и анализ в реальном времени – от одного запроса до потоковых сессий.
POST /v1/synthesize
«Добрый день. Это синтез русской речи.»
Решения
Четыре готовых продукта на одном API — от синтеза речи до контроля качества звонков.
Оценка 100% звонков по чек-листу, доказательства нарушений и алерты.
Подробнее →TL;DR, решения и задачи из записи совещания.
Подробнее →Теги, папки, PDF-экспорт и семантический поиск.
Подробнее →Биометрия по голосу и защита от подделки.
Подробнее →О платформе
Voice kit API – облачная платформа для работы с речью: нейронный синтез (Text-to-Speech) и клонирование голоса, транскрипция с таймкодами, стриминговая транскрипция и VAD-детекция в реальном времени, диаризация, интеллект-анализ (эмоции, тематики, резюме, PII-редактирование) и Voice ID – паспорт голоса, верификация 1:1 и идентификация 1:N. Подходит для озвучивания, голосовых помощников, колл-центров, интервью и совещаний.
Интеграция занимает минуты: зарегистрируйтесь, получите API-ключ и отправляйте HTTP- или WebSocket-запросы. Синтез возвращает аудио в MP3, WAV или OGG, транскрипция и анализ – структурированный JSON, стриминг – потоковые события. Платформа оптимизирована для русского языка и определяет язык записи автоматически.
Голоса с эмоциями и клонированием, стриминг TTS и STT, VAD-детекция, Voice ID – верификация и идентификация по голосу, синтез длинных текстов для аудиокниг, аудио- и видеоэффекты, вебхуки для асинхронных задач, официальные SDK и прозрачные тарифы – от бесплатного плана до корпоративных лимитов.
Возможности
Синтез, распознавание и интеллект-слой поверх аудио – в одном API.
29 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.
Свой голос из одной записи: 3–30 секунд чистой речи и синтез на 9 языках.
Превращайте статьи и книги в речь: асинхронный синтез с сэмпл-точным WAV и таймкод-манифестом по абзацам.
Аудио в текст с по-словными таймкодами, keyterm prompting и автоопределением языка. До 15 минут.
Тематики, резюме, PII-редактирование, определение языка и ключевые слова – без загрузки аудио.
Поиск по смыслу и ответы на вопросы по вашим записям (RAG) с дословными цитатами и таймкодами.
Паспорт голоса – язык, пол, возраст и эмоции – плюс верификация 1:1 и идентификация 1:N по отпечатку голоса.
Диаризация делит запись на спикеров, тональность показывает настроение по сегментам: радость, гнев, нейтрально.
Цепочка из 7 эффектов (реверб, эквалайзер, компрессор, питч) плюс шумоподавление и нормализация громкости в один клик.
Официальные Python, TypeScript, C#, Go, PHP и Java SDK для всех эндпоинтов.
PyPI · npm · NuGet · pkg.go.dev · Packagist · Maven Central
Массовый синтез и анализ одним запросом, фоновая обработка.
Уведомления о готовности асинхронных задач.
Полная спецификация Swagger для генерации клиентов.
Кому подойдёт
От колл-центров до продуктовых команд – закрываем задачи любой команды, работающей с русской речью.
Расшифровка звонков, диаризация спикеров и анализ эмоций – для контроля качества и обучения операторов.
Озвучка статей, курсов и видео естественными голосами, включая клонирование фирменного голоса.
REST и WebSocket, SDK на Python/JS/.NET, вебхуки и OpenAPI – интеграция за 15 минут.
Голосовые функции в вашем продукте – ассистенты, субтитры, аналитика звонков – без собственной ML-команды.
Демо
Синтез речи – до 500 символов, расшифровка аудио в текст – до 30 секунд. Без регистрации.
Результат распознавания
Без кода
В личном кабинете есть песочница: синтез, транскрипция и анализ – прямо из браузера, без единой строчки кода. Запросы учитываются в статистике вашего аккаунта.
Интеграции
Транскрипт, протокол встречи и оценка звонка уезжают прямо в сделку Битрикс24, amoCRM или 1С. Подключение выполняется один раз — дальше всё автоматически.
Один шов подключений для всех систем: входящий вебхук Битрикс24, токен amoCRM или HTTP-сервис 1С. Секреты хранятся зашифрованными, повторная отправка идемпотентна.
Решения, задачи с ответственными, риски и следующие шаги — в одном протоколе. Выгрузка в DOCX и PDF, публичная ссылка и отправка в CRM одной кнопкой.
Вебхуки meeting.completed и qa.violation позволяют повесить на готовый результат любые сценарии: уведомления, задачи, отчётность, напоминания.
Запись → транскрипция и диаризация → протокол или QA-оценка → сделка в CRM. Без ручной пересылки файлов.
Планы
Старт бесплатный. Пополните баланс криптовалютой и оплатите любой тариф в кабинете.
Бесплатно / месяц
390 ₽ / месяц
1490 ₽ / месяц
7990 ₽ / месяц
Некоторые тарифы временно недоступны для подключения – мы расширяем мощности и скоро вернём их.
Простая схема: символы синтеза, аудио-минуты (распознавание, анализ, эффекты) и LLM-токены для генеративных функций. Сверх лимита — поминутная оплата с баланса.





Интеграция
Ключ в X-Api-Key. Синтез возвращает бинарное аудио, транскрипция, VAD и анализ – JSON.
POST /v1/synthesize
Один POST – готовый аудиофайл.
POST /v1/synthesize
X-Api-Key: rtt_…
Content-Type: application/json
{
"text": "Добрый день. Это синтез русской речи.",
"voice": "preset_anna",
"format": "mp3"
}
POST /v1/transcribe
Асинхронный джоб с вебхуком: получите job_id и забирайте результат.
POST /v1/transcribe
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=meeting.mp3
language=ru
diarization=true
→ 202 { "job_id": "…" }
GET /v1/transcribe/{job_id}
→ { "transcript": "…", "segments": […] }
POST /v1/vad
Загрузите аудио и получите сегменты речи.
POST /v1/vad
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=call.mp3
→ {
"segments": [{ "start": 1.2, "end": 4.8 }],
"speech_ratio": 0.42,
"duration_seconds": 8.6,
"processing_time_ms": 123
}
POST /v1/analyze
Транскрипция + эмоции, ключевые слова, сущности и спикеры.
POST /v1/analyze
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=call.mp3
language=ru
→ {
"transcript": "…",
"segments": […],
"keywords": […],
"entities": […],
"speakers": […]
}
POST /v1/synthesize/async
Асинхронный синтез длинных текстов с таймкод-манифестом по абзацам.
POST /v1/synthesize/async
X-Api-Key: rtt_…
Content-Type: application/json
{
"text": "Глава 1. …\n\nГлава 2. …",
"voice": "preset_anna"
}
→ 202 { "job_id": "…" }
GET /v1/synthesize/async/{job_id}
→ { "paragraphs": [{ "start": 0.0, "end": 12.4 }] }
GET /v1/synthesize/async/{job_id}/audio
→ WAV · sample-accurate
POST /v1/audio/effects
Цепочка эффектов для аудио и видео – асинхронный джоб с вебхуком.
POST /v1/audio/effects
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=voice.wav
effects=[{"type":"reverb"},{"type":"eq","bands":[…] }]
output_format=mp3
→ 202 { "job_id": "…" }
GET /v1/audio/effects/{job_id}/audio
→ processed audio
Платформа
Блог
Туториалы и разборы: распознавание и синтез речи, диаризация, клонирование голоса.
От получения API-ключа до транскрибации с таймкодами на Python – готовый код внутри.
Читать статью →Качество, цена и задержка трёх TTS API для русского – с вердиктом.
Читать статью →Кто говорит в записи – простыми словами, с примерами через API.
Читать статью →FAQ
Это REST-платформа, объединяющая синтез речи, транскрипцию и анализ аудио. Вы отправляете запрос с API-ключом и получаете готовый аудиофайл или структурированный JSON.
Синтез оптимизирован для русского языка, транскрипция автоматически определяет язык записи. Аудио возвращается в форматах MP3, WAV и OGG.
Зарегистрируйтесь в кабинете – ключ создаётся автоматически. Передавайте его в заголовке X-Api-Key при каждом запросе.
Да, план Free включает 5 000 символов синтеза, 100 минут аудио и 30 минут аудиоэффектов в месяц – без привязки карты.
Оплатите тариф в личном кабинете – принимаем оплату по СБП и банковскими картами, а также криптовалютой (USDT, BTC, ETH). Подписка продлевается автоматически.
Клонирование голоса (9 языков) доступно на Basic (до 5 голосов), Pro (до 50) и Business (до 500) через POST /v1/voices/clone. Стриминговая транскрипция и VAD по WebSocket доступны на Pro и Business.