Синтез речи
9 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.
Синтез · Транскрипция · Realtime · Интеллект
Одна платформа для речи: нейронный синтез и клонирование голоса, стриминговая транскрипция, VAD-детекция и интеллект-анализ. REST и WebSocket — от одного запроса до потоковых сессий.
Возможности
Синтез, распознавание и интеллект-слой поверх аудио — в одном API.
9 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.
XTTS v2: свой голос из 1–3 образцов и 17 языков. Premium-модель на Pro и Business.
Аудио в текст с по-словными таймкодами, keyterm prompting и автоопределением языка. До 15 минут.
Транскрипция в реальном времени по WebSocket: события partial и final с VAD-эндпоинтингом.
Silero VAD находит границы речи: события speech_started / speech_ended — база для голосовых агентов.
Кто говорит: разделение записи на спикеров для встреч, интервью и колл-центров.
Настроение речи по сегментам: радость, гнев, нейтрально. Полезно для HR, маркетинга и поддержки.
Тематики, резюме, PII-редактирование и определение языка — без загрузки аудио.
Автоматические теги для архивов, поиска и SEO — извлекаются из транскрипции без усилий.
Официальные Python и TypeScript SDK для всех эндпоинтов.
Массовый синтез и анализ одним запросом, фоновая обработка.
Уведомления о готовности асинхронных задач.
Полная спецификация Swagger для генерации клиентов.
Realtime
WebSocket-эндпоинты для живых сценариев: потоковая транскрипция и детекция речи с событиями.
Отправляйте PCM16-кадры — получайте partial по ходу речи и final на конце фразы.
WS /v1/transcribe/stream?api_key=rtt_…
→ send: PCM16 · little-endian · mono · 16 kHz
→ send: {"type":"stop"}
← {"type":"session","event":"started"}
← {"type":"partial","text":"Привет, "}
← {"type":"final","text":"Привет, мир!"}
← {"type":"vad","event":"speech_ended"}
← {"type":"session","event":"ended"}
Ловите speech_started / speech_ended, чтобы управлять диалогом и перебиваниями.
WS /v1/vad/stream?api_key=rtt_…
→ send: PCM16 · little-endian · mono · 16 kHz
← {"type":"vad","event":"speech_started","start":1.20}
← {"type":"vad","event":"speech_ended","start":1.20,"end":4.85}
Демо
До 200 символов, без регистрации. Выберите голос, эмоцию и формат.
Планы
Старт бесплатный. Пополните баланс криптовалютой и оплатите любой тариф в кабинете.
Бесплатно / месяц
$4,90 / месяц
$19,90 / месяц
$99,90 / месяц
Некоторые тарифы временно недоступны для подключения — мы расширяем мощности и скоро вернём их.
| Возможность | Free | Basic | Pro | Business |
|---|---|---|---|---|
| Цена | Бесплатно | $4,90 | $19,90 | $99,90 |
| Синтез (символов/мес) | 5 000 | 100 000 | 500 000 | 3 000 000 |
| Премиум-синтез XTTS (символов/мес) | — | — | 50 000 | 300 000 |
| Транскрипция (мин/мес) | 30 | 300 | 1500 | 5000 |
| Диаризация | — | ✓ | ✓ | ✓ |
| Клонирование голоса | — | — | 5 | ∞ |
| Стриминг TTS и STT | — | — | ✓ | ✓ |
| VAD (batch) | ✓ | ✓ | ✓ | ✓ |
| VAD-стрим / turn detection | — | — | ✓ | ✓ |
| Анализ (запросов/мес) | 10 | 100 | 500 | 3000 |
| Текст-интеллект (topics · summary · PII) | ✓ | ✓ | ✓ | ✓ |
| Определение языка | ✓ | ✓ | ✓ | ✓ |
| Приоритетная очередь | — | — | — | ✓ |
✓ — включено, — — недоступно, ∞ — без лимита.
Интеграция
Ключ в X-Api-Key или X-RapidAPI-Key. Синтез возвращает бинарное аудио, транскрипция, VAD и анализ — JSON.
Один POST — готовый аудиофайл.
POST /v1/synthesize
X-Api-Key: rtt_…
Content-Type: application/json
{
"text": "Добрый день. Это синтез русской речи.",
"voice": "natasha",
"format": "mp3"
}
Асинхронный джоб с вебхуком: получите job_id и забирайте результат.
POST /v1/transcribe
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=meeting.mp3
language=ru
diarization=true
→ 202 { "job_id": "…" }
GET /v1/transcribe/{job_id}
→ { "transcript": "…", "segments": […] }
Загрузите аудио и получите сегменты речи (Silero VAD).
POST /v1/vad
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=call.mp3
→ {
"segments": [{ "start": 1.2, "end": 4.8 }],
"speech_ratio": 0.42,
"duration_seconds": 8.6,
"processing_time_ms": 123
}
Транскрипция + эмоции, ключевые слова, сущности и спикеры.
POST /v1/analyze
X-Api-Key: rtt_…
Content-Type: multipart/form-data
audio=call.mp3
language=ru
→ {
"transcript": "…",
"segments": […],
"keywords": […],
"entities": […],
"speakers": […]
}
О платформе
Voice Intelligence API — облачная платформа для работы с речью: нейронный синтез (Text-to-Speech) и клонирование голоса, транскрипция с таймкодами, стриминговая транскрипция и VAD-детекция в реальном времени, диаризация и интеллект-анализ (эмоции, тематики, резюме, PII-редактирование). Подходит для озвучивания, голосовых помощников, колл-центров, интервью и совещаний.
Интеграция занимает минуты: зарегистрируйтесь, получите API-ключ и отправляйте HTTP- или WebSocket-запросы. Синтез возвращает аудио в MP3, WAV или OGG, транскрипция и анализ — структурированный JSON, стриминг — потоковые события. Платформа оптимизирована для русского языка и определяет язык записи автоматически.
Голоса с эмоциями и клонированием, стриминг TTS и STT, VAD-детекция, вебхуки для асинхронных задач, официальные SDK и прозрачные тарифы — от бесплатного плана до корпоративных лимитов.
FAQ
Это REST-платформа, объединяющая синтез речи, транскрипцию и анализ аудио. Вы отправляете запрос с API-ключом и получаете готовый аудиофайл или структурированный JSON.
Синтез оптимизирован для русского языка, транскрипция автоматически определяет язык записи. Аудио возвращается в форматах MP3, WAV и OGG.
Зарегистрируйтесь в кабинете — ключ создаётся автоматически. Передавайте его в заголовке X-Api-Key при каждом запросе.
Да, план Free включает 5 000 символов синтеза, 30 минут транскрипции и 10 запросов анализа в месяц — без привязки карты.
Пополните баланс криптовалютой (USDT, BTC, ETH) и оплатите любой тариф в личном кабинете — подписка продлевается автоматически.
Да. На тарифах Pro и Business доступны стриминговая транскрипция и VAD по WebSocket, а также клонирование голоса XTTS v2 (17 языков) через POST /v1/voices/clone.