Синтез · Транскрипция · Realtime · Интеллект

Voice kit API – платформа для синтеза и распознавания речи

Облачный API для работы с речью: нейронный синтез и клонирование голоса, расшифровка аудио в текст и анализ в реальном времени – от одного запроса до потоковых сессий.

Решения

Голосовой ИИ под вашу задачу

Четыре готовых продукта на одном API — от синтеза речи до контроля качества звонков.

О платформе

API синтеза и распознавания речи

Voice kit API – облачная платформа для работы с речью: нейронный синтез (Text-to-Speech) и клонирование голоса, транскрипция с таймкодами, стриминговая транскрипция и VAD-детекция в реальном времени, диаризация, интеллект-анализ (эмоции, тематики, резюме, PII-редактирование) и Voice ID – паспорт голоса, верификация 1:1 и идентификация 1:N. Подходит для озвучивания, голосовых помощников, колл-центров, интервью и совещаний.

Интеграция занимает минуты: зарегистрируйтесь, получите API-ключ и отправляйте HTTP- или WebSocket-запросы. Синтез возвращает аудио в MP3, WAV или OGG, транскрипция и анализ – структурированный JSON, стриминг – потоковые события. Платформа оптимизирована для русского языка и определяет язык записи автоматически.

Голоса с эмоциями и клонированием, стриминг TTS и STT, VAD-детекция, Voice ID – верификация и идентификация по голосу, синтез длинных текстов для аудиокниг, аудио- и видеоэффекты, вебхуки для асинхронных задач, официальные SDK и прозрачные тарифы – от бесплатного плана до корпоративных лимитов.

Возможности

Что умеет платформа

Синтез, распознавание и интеллект-слой поверх аудио – в одном API.

Генерация речи

Синтез речи

29 голосов, эмоции, скорость и тон. MP3, WAV, OGG и стриминг чанками для длинных текстов.

Клонирование голоса

Свой голос из одной записи: 3–30 секунд чистой речи и синтез на 9 языках.

Синтез длинных текстов

Превращайте статьи и книги в речь: асинхронный синтез с сэмпл-точным WAV и таймкод-манифестом по абзацам.

Распознавание речи

Транскрипция

Аудио в текст с по-словными таймкодами, keyterm prompting и автоопределением языка. До 15 минут.

Текст-интеллект

Тематики, резюме, PII-редактирование, определение языка и ключевые слова – без загрузки аудио.

Семантический поиск и Q&A

Поиск по смыслу и ответы на вопросы по вашим записям (RAG) с дословными цитатами и таймкодами.

Голосовой интеллект и звук

Спикеры и эмоции

Диаризация делит запись на спикеров, тональность показывает настроение по сегментам: радость, гнев, нейтрально.

Обработка аудио

Цепочка из 7 эффектов (реверб, эквалайзер, компрессор, питч) плюс шумоподавление и нормализация громкости в один клик.

Batch

Массовый синтез и анализ одним запросом, фоновая обработка.

Вебхуки

Уведомления о готовности асинхронных задач.

OpenAPI

Полная спецификация Swagger для генерации клиентов.

Кому подойдёт

Кому подойдёт Voice kit API

От колл-центров до продуктовых команд – закрываем задачи любой команды, работающей с русской речью.

Колл-центры

Расшифровка звонков, диаризация спикеров и анализ эмоций – для контроля качества и обучения операторов.

Контент и EdTech

Озвучка статей, курсов и видео естественными голосами, включая клонирование фирменного голоса.

Разработчики

REST и WebSocket, SDK на Python/JS/.NET, вебхуки и OpenAPI – интеграция за 15 минут.

Продуктовые команды

Голосовые функции в вашем продукте – ассистенты, субтитры, аналитика звонков – без собственной ML-команды.

Демо

Попробуйте платформу без ключа

Синтез речи – до 500 символов, расшифровка аудио в текст – до 30 секунд. Без регистрации.

Без кода

API без программирования

В личном кабинете есть песочница: синтез, транскрипция и анализ – прямо из браузера, без единой строчки кода. Запросы учитываются в статистике вашего аккаунта.

Интеграции

Замкните цикл: от записи — до сделки в CRM

Транскрипт, протокол встречи и оценка звонка уезжают прямо в сделку Битрикс24, amoCRM или 1С. Подключение выполняется один раз — дальше всё автоматически.

Протокол как документ

Решения, задачи с ответственными, риски и следующие шаги — в одном протоколе. Выгрузка в DOCX и PDF, публичная ссылка и отправка в CRM одной кнопкой.

События для автоматизации

Вебхуки meeting.completed и qa.violation позволяют повесить на готовый результат любые сценарии: уведомления, задачи, отчётность, напоминания.

Запись → транскрипция и диаризация → протокол или QA-оценка → сделка в CRM. Без ручной пересылки файлов.

Планы

Тарифы

Старт бесплатный. Пополните баланс криптовалютой и оплатите любой тариф в кабинете.

Free

Бесплатно / месяц

  • 5 000 символов синтеза
  • 150 аудио-минут
  • Без диаризации
  • Без клонирования
  • —
  • —
  • Без стриминга
  • Аудиоэффекты
  • Стандартная очередь
Начать бесплатно

Basic

390 ₽ / месяц

  • 500 000 символов синтеза
  • 1800 аудио-минут
  • Диаризация
  • Клонирование голоса — до 5 голосов
  • —
  • —
  • Без стриминга
  • Аудиоэффекты
  • Стандартная очередь
Оплатить

Business

7990 ₽ / месяц

  • 7 000 000 символов синтеза
  • 30000 аудио-минут
  • 1 000 000 LLM-токенов
  • Диаризация
  • Клонирование голоса — до 500 голосов
  • Call QA (контроль звонков)
  • Интеграции с CRM
  • Стриминг чанками
  • Аудиоэффекты
  • Приоритетная очередь
Временно недоступен

Некоторые тарифы временно недоступны для подключения – мы расширяем мощности и скоро вернём их.

Простая схема: символы синтеза, аудио-минуты (распознавание, анализ, эффекты) и LLM-токены для генеративных функций. Сверх лимита — поминутная оплата с баланса.

Принимаем к оплате
  • СБП
  • МИР
  • Visa
  • Mastercard
  • Криптовалюта

Интеграция

Два вызова – и вся платформа

Ключ в X-Api-Key. Синтез возвращает бинарное аудио, транскрипция, VAD и анализ – JSON.

Синтез речи

POST /v1/synthesize

Один POST – готовый аудиофайл.

Показать пример запроса
POST /v1/synthesize
X-Api-Key: rtt_…
Content-Type: application/json

{
  "text": "Добрый день. Это синтез русской речи.",
  "voice": "preset_anna",
  "format": "mp3"
}

Транскрипция

POST /v1/transcribe

Асинхронный джоб с вебхуком: получите job_id и забирайте результат.

Показать пример запроса
POST /v1/transcribe
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=meeting.mp3
language=ru
diarization=true

→ 202 { "job_id": "…" }

GET /v1/transcribe/{job_id}
→ { "transcript": "…", "segments": […] }

VAD / turn detection

POST /v1/vad

Загрузите аудио и получите сегменты речи.

Показать пример запроса
POST /v1/vad
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=call.mp3

→ {
  "segments": [{ "start": 1.2, "end": 4.8 }],
  "speech_ratio": 0.42,
  "duration_seconds": 8.6,
  "processing_time_ms": 123
}

Анализ аудио

POST /v1/analyze

Транскрипция + эмоции, ключевые слова, сущности и спикеры.

Показать пример запроса
POST /v1/analyze
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=call.mp3
language=ru

→ {
  "transcript": "…",
  "segments": […],
  "keywords": […],
  "entities": […],
  "speakers": […]
}

Синтез длинных текстов

POST /v1/synthesize/async

Асинхронный синтез длинных текстов с таймкод-манифестом по абзацам.

Показать пример запроса
POST /v1/synthesize/async
X-Api-Key: rtt_…
Content-Type: application/json

{
  "text": "Глава 1. …\n\nГлава 2. …",
  "voice": "preset_anna"
}

→ 202 { "job_id": "…" }

GET /v1/synthesize/async/{job_id}
→ { "paragraphs": [{ "start": 0.0, "end": 12.4 }] }

GET /v1/synthesize/async/{job_id}/audio
→ WAV · sample-accurate

Аудиоэффекты

POST /v1/audio/effects

Цепочка эффектов для аудио и видео – асинхронный джоб с вебхуком.

Показать пример запроса
POST /v1/audio/effects
X-Api-Key: rtt_…
Content-Type: multipart/form-data

audio=voice.wav
effects=[{"type":"reverb"},{"type":"eq","bands":[…] }]
output_format=mp3

→ 202 { "job_id": "…" }

GET /v1/audio/effects/{job_id}/audio
→ processed audio

Платформа

Один API — все режимы работы с речью

Блог

Из блога

Туториалы и разборы: распознавание и синтез речи, диаризация, клонирование голоса.

FAQ

Частые вопросы

Что такое Voice kit API?

Это REST-платформа, объединяющая синтез речи, транскрипцию и анализ аудио. Вы отправляете запрос с API-ключом и получаете готовый аудиофайл или структурированный JSON.

Какие языки и форматы поддерживаются?

Синтез оптимизирован для русского языка, транскрипция автоматически определяет язык записи. Аудио возвращается в форматах MP3, WAV и OGG.

Как получить API-ключ?

Зарегистрируйтесь в кабинете – ключ создаётся автоматически. Передавайте его в заголовке X-Api-Key при каждом запросе.

Есть ли бесплатный тариф?

Да, план Free включает 5 000 символов синтеза, 100 минут аудио и 30 минут аудиоэффектов в месяц – без привязки карты.

Как оплатить тариф?

Оплатите тариф в личном кабинете – принимаем оплату по СБП и банковскими картами, а также криптовалютой (USDT, BTC, ETH). Подписка продлевается автоматически.

Есть ли стриминг в реальном времени и клонирование голоса?

Клонирование голоса (9 языков) доступно на Basic (до 5 голосов), Pro (до 50) и Business (до 500) через POST /v1/voices/clone. Стриминговая транскрипция и VAD по WebSocket доступны на Pro и Business.