Синтез · Транскрипция · Realtime · Интеллект

Voice Intelligence API

Одна платформа для речи: нейронный синтез и клонирование голоса, стриминговая транскрипция, VAD-детекция и интеллект-анализ. REST и WebSocket — от одного запроса до потоковых сессий.

Возможности

Что умеет платформа

Синтез, распознавание и интеллект-слой поверх аудио — в одном API.

Синтез речи

9 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.

Клонирование голоса Новое

XTTS v2: свой голос из 1–3 образцов и 17 языков. Premium-модель на Pro и Business.

Транскрипция

Аудио в текст с по-словными таймкодами, keyterm prompting и автоопределением языка. До 15 минут.

Стриминговая транскрипция Новое

Транскрипция в реальном времени по WebSocket: события partial и final с VAD-эндпоинтингом.

VAD / turn detection Новое

Silero VAD находит границы речи: события speech_started / speech_ended — база для голосовых агентов.

Диаризация

Кто говорит: разделение записи на спикеров для встреч, интервью и колл-центров.

Анализ тональности

Настроение речи по сегментам: радость, гнев, нейтрально. Полезно для HR, маркетинга и поддержки.

Текст-интеллект Новое

Тематики, резюме, PII-редактирование и определение языка — без загрузки аудио.

Ключевые слова

Автоматические теги для архивов, поиска и SEO — извлекаются из транскрипции без усилий.

SDK

Официальные Python и TypeScript SDK для всех эндпоинтов.

Batch

Массовый синтез и анализ одним запросом, фоновая обработка.

Вебхуки

Уведомления о готовности асинхронных задач.

OpenAPI

Полная спецификация Swagger для генерации клиентов.

Realtime

Речь в реальном времени

WebSocket-эндпоинты для живых сценариев: потоковая транскрипция и детекция речи с событиями.

Стриминговая транскрипция

Отправляйте PCM16-кадры — получайте partial по ходу речи и final на конце фразы.

WS /v1/transcribe/stream?api_key=rtt_…
→ send: PCM16 · little-endian · mono · 16 kHz
→ send: {"type":"stop"}

← {"type":"session","event":"started"}
← {"type":"partial","text":"Привет, "}
← {"type":"final","text":"Привет, мир!"}
← {"type":"vad","event":"speech_ended"}
← {"type":"session","event":"ended"}

VAD / turn detection

Ловите speech_started / speech_ended, чтобы управлять диалогом и перебиваниями.

WS /v1/vad/stream?api_key=rtt_…
→ send: PCM16 · little-endian · mono · 16 kHz

← {"type":"vad","event":"speech_started","start":1.20}
← {"type":"vad","event":"speech_ended","start":1.20,"end":4.85}

Демо

Попробуйте синтез без ключа

До 200 символов, без регистрации. Выберите голос, эмоцию и формат.

Планы

Тарифы

Старт бесплатный. Пополните баланс криптовалютой и оплатите любой тариф в кабинете.

Free

Бесплатно / месяц

  • 5 000 символов синтеза
  • 30 мин транскрипции
  • Без диаризации
  • Без клонирования
  • 10 анализов
  • Без стриминга
  • Стандартная очередь
Начать бесплатно

Basic

$4,90 / месяц

  • 100 000 символов синтеза
  • 300 мин транскрипции
  • Диаризация
  • Без клонирования
  • 100 анализов
  • Без стриминга
  • Стандартная очередь
Оплатить

Business

$99,90 / месяц

  • 3 000 000 символов синтеза
  • 5000 мин транскрипции
  • Диаризация
  • Клонирование голоса (XTTS)
  • 3000 анализов
  • Стриминг чанками
  • Приоритетная очередь
Временно недоступен

Некоторые тарифы временно недоступны для подключения — мы расширяем мощности и скоро вернём их.

Возможность Free Basic Pro Business
Цена Бесплатно $4,90 $19,90 $99,90
Синтез (символов/мес) 5 000 100 000 500 000 3 000 000
Премиум-синтез XTTS (символов/мес) 50 000 300 000
Транскрипция (мин/мес) 30 300 1500 5000
Диаризация
Клонирование голоса 5
Стриминг TTS и STT
VAD (batch)
VAD-стрим / turn detection
Анализ (запросов/мес) 10 100 500 3000
Текст-интеллект (topics · summary · PII)
Определение языка
Приоритетная очередь

✓ — включено, — — недоступно, ∞ — без лимита.

Интеграция

Два вызова — и вся платформа

Ключ в X-Api-Key или X-RapidAPI-Key. Синтез возвращает бинарное аудио, транскрипция, VAD и анализ — JSON.

Синтез речи

Один POST — готовый аудиофайл.

POST /v1/synthesize
X-Api-Key: rtt_…
Content-Type: application/json

{
  "text": "Добрый день. Это синтез русской речи.",
  "voice": "natasha",
  "format": "mp3"
}

Транскрипция

Асинхронный джоб с вебхуком: получите job_id и забирайте результат.

POST /v1/transcribe
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=meeting.mp3
language=ru
diarization=true

→ 202 { "job_id": "…" }

GET /v1/transcribe/{job_id}
→ { "transcript": "…", "segments": […] }

VAD / turn detection

Загрузите аудио и получите сегменты речи (Silero VAD).

POST /v1/vad
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=call.mp3

→ {
  "segments": [{ "start": 1.2, "end": 4.8 }],
  "speech_ratio": 0.42,
  "duration_seconds": 8.6,
  "processing_time_ms": 123
}

Анализ аудио

Транскрипция + эмоции, ключевые слова, сущности и спикеры.

POST /v1/analyze
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=call.mp3
language=ru

→ {
  "transcript": "…",
  "segments": […],
  "keywords": […],
  "entities": […],
  "speakers": […]
}

О платформе

API синтеза и распознавания русской речи

Voice Intelligence API — облачная платформа для работы с речью: нейронный синтез (Text-to-Speech) и клонирование голоса, транскрипция с таймкодами, стриминговая транскрипция и VAD-детекция в реальном времени, диаризация и интеллект-анализ (эмоции, тематики, резюме, PII-редактирование). Подходит для озвучивания, голосовых помощников, колл-центров, интервью и совещаний.

Интеграция занимает минуты: зарегистрируйтесь, получите API-ключ и отправляйте HTTP- или WebSocket-запросы. Синтез возвращает аудио в MP3, WAV или OGG, транскрипция и анализ — структурированный JSON, стриминг — потоковые события. Платформа оптимизирована для русского языка и определяет язык записи автоматически.

Голоса с эмоциями и клонированием, стриминг TTS и STT, VAD-детекция, вебхуки для асинхронных задач, официальные SDK и прозрачные тарифы — от бесплатного плана до корпоративных лимитов.

FAQ

Частые вопросы

Что такое Voice Intelligence API?

Это REST-платформа, объединяющая синтез речи, транскрипцию и анализ аудио. Вы отправляете запрос с API-ключом и получаете готовый аудиофайл или структурированный JSON.

Какие языки и форматы поддерживаются?

Синтез оптимизирован для русского языка, транскрипция автоматически определяет язык записи. Аудио возвращается в форматах MP3, WAV и OGG.

Как получить API-ключ?

Зарегистрируйтесь в кабинете — ключ создаётся автоматически. Передавайте его в заголовке X-Api-Key при каждом запросе.

Есть ли бесплатный тариф?

Да, план Free включает 5 000 символов синтеза, 30 минут транскрипции и 10 запросов анализа в месяц — без привязки карты.

Как оплатить тариф?

Пополните баланс криптовалютой (USDT, BTC, ETH) и оплатите любой тариф в личном кабинете — подписка продлевается автоматически.

Есть ли стриминг в реальном времени и клонирование голоса?

Да. На тарифах Pro и Business доступны стриминговая транскрипция и VAD по WebSocket, а также клонирование голоса XTTS v2 (17 языков) через POST /v1/voices/clone.