Синтез · Транскрипция · Realtime · Интеллект

VoiceKit

Нейронный синтез и клонирование голоса без ограничений — создайте сколько угодно своих голосов из одной записи. Плюс стриминговая транскрипция, VAD-детекция и интеллект-анализ. REST и WebSocket — от одного запроса до потоковых сессий.

Возможности

Что умеет платформа

Синтез, распознавание и интеллект-слой поверх аудио — в одном API.

Синтез речи

29 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.

Клонирование голоса Новое

Свой голос из одной записи: 3–30 секунд чистой речи и синтез на 9 языках.

Транскрипция

Аудио в текст с по-словными таймкодами, keyterm prompting и автоопределением языка. До 15 минут.

Стриминговая транскрипция Новое

Транскрипция в реальном времени по WebSocket: события partial и final с VAD-эндпоинтингом.

VAD / turn detection Новое

Находит границы речи: события speech_started / speech_ended — база для голосовых агентов.

Диаризация

Кто говорит: разделение записи на спикеров для встреч, интервью и колл-центров.

Анализ тональности

Настроение речи по сегментам: радость, гнев, нейтрально. Полезно для HR, маркетинга и поддержки.

Текст-интеллект Новое

Тематики, резюме, PII-редактирование и определение языка — без загрузки аудио.

Ключевые слова

Автоматические теги для архивов, поиска и SEO — извлекаются из транскрипции без усилий.

Аудиоэффекты Новое

Реверберация, эквалайзер, компрессор, питч и другие — цепочка из 7 эффектов для аудио и видео, применяется асинхронно.

Синтез длинных текстов Новое

Превращайте статьи и книги в речь: асинхронный синтез с сэмпл-точным WAV и таймкод-манифестом по абзацам.

SDK

Официальные Python и TypeScript SDK для всех эндпоинтов.

Batch

Массовый синтез и анализ одним запросом, фоновая обработка.

Вебхуки

Уведомления о готовности асинхронных задач.

OpenAPI

Полная спецификация Swagger для генерации клиентов.

Демо

Попробуйте синтез без ключа

До 500 символов, без регистрации. Выберите голос и скорость.

Без кода

API без программирования

В личном кабинете есть песочница: синтез, транскрипция и анализ — прямо из браузера, без единой строчки кода. Запросы уходят под вашим ключом и учитываются в статистике.

Планы

Тарифы

Старт бесплатный. Пополните баланс криптовалютой и оплатите любой тариф в кабинете.

Free

Бесплатно / месяц

  • 5 000 символов синтеза
  • 30 мин транскрипции
  • Без диаризации
  • Без клонирования
  • 10 анализов
  • Без стриминга
  • Без аудиоэффектов
  • Стандартная очередь
Начать бесплатно

Basic

$4,90 / месяц

  • 100 000 символов синтеза
  • 300 мин транскрипции
  • Диаризация
  • Без клонирования
  • 100 анализов
  • Без стриминга
  • Без аудиоэффектов
  • Стандартная очередь
Оплатить

Business

$99,90 / месяц

  • 3 000 000 символов синтеза
  • 5000 мин транскрипции
  • Диаризация
  • Клонирование голоса
  • 3000 анализов
  • Стриминг чанками
  • 600 мин аудиоэффектов
  • Приоритетная очередь
Временно недоступен

Некоторые тарифы временно недоступны для подключения — мы расширяем мощности и скоро вернём их.

Возможность Free Basic Pro Business
Цена Бесплатно $4,90 $19,90 $99,90
Синтез (символов/мес) 5 000 100 000 500 000 3 000 000
Премиум-синтез (символов/мес) 50 000 300 000
Транскрипция (мин/мес) 30 300 1500 5000
Диаризация
Клонирование голоса 5
Стриминг TTS и STT
Синтез длинных текстов (WAV-манифест)
Аудиоэффекты (мин/мес) 60 600
Видеоэффекты (мин/мес) 60 600
VAD (batch)
VAD-стрим / turn detection
Анализ (запросов/мес) 10 100 500 3000
Текст-интеллект (topics · summary · PII)
Определение языка
Приоритетная очередь

✓ — включено, — — недоступно, ∞ — без лимита.

Интеграция

Два вызова — и вся платформа

Ключ в X-Api-Key или X-RapidAPI-Key. Синтез возвращает бинарное аудио, транскрипция, VAD и анализ — JSON.

Синтез речи

Один POST — готовый аудиофайл.

POST /v1/synthesize
X-Api-Key: rtt_…
Content-Type: application/json

{
  "text": "Добрый день. Это синтез русской речи.",
  "voice": "preset_anna",
  "format": "mp3"
}

Транскрипция

Асинхронный джоб с вебхуком: получите job_id и забирайте результат.

POST /v1/transcribe
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=meeting.mp3
language=ru
diarization=true

→ 202 { "job_id": "…" }

GET /v1/transcribe/{job_id}
→ { "transcript": "…", "segments": […] }

VAD / turn detection

Загрузите аудио и получите сегменты речи.

POST /v1/vad
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=call.mp3

→ {
  "segments": [{ "start": 1.2, "end": 4.8 }],
  "speech_ratio": 0.42,
  "duration_seconds": 8.6,
  "processing_time_ms": 123
}

Анализ аудио

Транскрипция + эмоции, ключевые слова, сущности и спикеры.

POST /v1/analyze
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=call.mp3
language=ru

→ {
  "transcript": "…",
  "segments": […],
  "keywords": […],
  "entities": […],
  "speakers": […]
}

Синтез длинных текстов

Асинхронный синтез длинных текстов с таймкод-манифестом по абзацам.

POST /v1/synthesize/async
X-Api-Key: rtt_…
Content-Type: application/json

{
  "text": "Глава 1. …\n\nГлава 2. …",
  "voice": "preset_anna"
}

→ 202 { "job_id": "…" }

GET /v1/synthesize/async/{job_id}
→ { "paragraphs": [{ "start": 0.0, "end": 12.4 }] }

GET /v1/synthesize/async/{job_id}/audio
→ WAV · sample-accurate

Аудиоэффекты

Цепочка эффектов для аудио и видео — асинхронный джоб с вебхуком.

POST /v1/audio/effects
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=voice.wav
effects=[{"type":"reverb"},{"type":"eq","bands":[…] }]
output_format=mp3

→ 202 { "job_id": "…" }

GET /v1/audio/effects/{job_id}/audio
→ processed audio

Речь в реальном времени

WebSocket-эндпоинты для живых сценариев: потоковая транскрипция и детекция речи с событиями.

Стриминговая транскрипция

Отправляйте PCM16-кадры — получайте partial по ходу речи и final на конце фразы.

WS /v1/transcribe/stream?api_key=rtt_…
→ send: PCM16 · little-endian · mono · 16 kHz
→ send: {"type":"stop"}

← {"type":"session","event":"started"}
← {"type":"partial","text":"Привет, "}
← {"type":"final","text":"Привет, мир!"}
← {"type":"vad","event":"speech_ended"}
← {"type":"session","event":"ended"}

VAD / turn detection

Ловите speech_started / speech_ended, чтобы управлять диалогом и перебиваниями.

WS /v1/vad/stream?api_key=rtt_…
→ send: PCM16 · little-endian · mono · 16 kHz

← {"type":"vad","event":"speech_started","start":1.20}
← {"type":"vad","event":"speech_ended","start":1.20,"end":4.85}

О платформе

API синтеза и распознавания русской речи

VoiceKit — облачная платформа для работы с речью: нейронный синтез (Text-to-Speech) и клонирование голоса, транскрипция с таймкодами, стриминговая транскрипция и VAD-детекция в реальном времени, диаризация и интеллект-анализ (эмоции, тематики, резюме, PII-редактирование). Подходит для озвучивания, голосовых помощников, колл-центров, интервью и совещаний.

Интеграция занимает минуты: зарегистрируйтесь, получите API-ключ и отправляйте HTTP- или WebSocket-запросы. Синтез возвращает аудио в MP3, WAV или OGG, транскрипция и анализ — структурированный JSON, стриминг — потоковые события. Платформа оптимизирована для русского языка и определяет язык записи автоматически.

Голоса с эмоциями и клонированием, стриминг TTS и STT, VAD-детекция, синтез длинных текстов для аудиокниг, аудио- и видеоэффекты, вебхуки для асинхронных задач, официальные SDK и прозрачные тарифы — от бесплатного плана до корпоративных лимитов.

FAQ

Частые вопросы

Что такое VoiceKit?

Это REST-платформа, объединяющая синтез речи, транскрипцию и анализ аудио. Вы отправляете запрос с API-ключом и получаете готовый аудиофайл или структурированный JSON.

Какие языки и форматы поддерживаются?

Синтез оптимизирован для русского языка, транскрипция автоматически определяет язык записи. Аудио возвращается в форматах MP3, WAV и OGG.

Как получить API-ключ?

Зарегистрируйтесь в кабинете — ключ создаётся автоматически. Передавайте его в заголовке X-Api-Key при каждом запросе.

Есть ли бесплатный тариф?

Да, план Free включает 5 000 символов синтеза, 30 минут транскрипции и 10 запросов анализа в месяц — без привязки карты.

Как оплатить тариф?

Пополните баланс криптовалютой (USDT, BTC, ETH) и оплатите любой тариф в личном кабинете — подписка продлевается автоматически.

Есть ли стриминг в реальном времени и клонирование голоса?

Да. На тарифах Pro и Business доступны стриминговая транскрипция и VAD по WebSocket, а также клонирование голоса (9 языков) через POST /v1/voices/clone.