Распознавание речи · Локально

Из эфира —
в готовый текст

Speech2Text расшифровывает русскую речь на Whisper large-v3-turbo и разделяет собеседников по голосам. Загрузите эфир, интервью или запись опроса — получите текст диалога с тайм-кодами.

Whisper large-v3-turbo · GPU · Диаризация

Возможности

Всё, что нужно для расшифровки

Без облачных подписок и лишних настроек: загрузили запись — получили текст, который можно сразу отдавать в работу.

Точность Whisper large-v3-turbo

Свежая модель Whisper уверенно распознаёт русскую речь — с беглыми репликами, именами и терминами — и сама расставляет пунктуацию.

Разделение собеседников

Диаризация помечает, кто говорит: на выходе — готовый текст диалога с репликами «Собеседник 1», «Собеседник 2» и далее.

Быстрее реального времени

Распознавание идёт на GPU, поэтому запись расшифровывается быстрее, чем звучит. Очередь заданий видна в студии.

Тайм-коды и субтитры

Пословные метки времени и готовый файл SRT: легко найти нужную цитату в записи и собрать субтитры к видео.

REST API для интеграций

Обычный REST плюс OpenAI-совместимый эндпоинт: клиенты и скрипты, написанные под облачный API, подключаются без переделки.

Работает в вашем контуре

Сервис развёрнут на вашем сервере: записи и расшифровки не покидают редакцию и не уходят во внешние облака.

Как это работает

Три шага от записи до текста

Порядок всегда один и тот же — в студии и по API.

01

Загрузите запись

Перетащите файл в студию или отправьте его по API. Подходят аудио и видео в привычных форматах.

MP3WAVM4AMP4OGG
02

Распознавание и разметка

Whisper расшифровывает речь на GPU, диаризация раскладывает реплики по голосам и проставляет тайм-коды.

GPUДиаризацияТайм-коды
03

Заберите готовый текст

Скачайте расшифровку в удобном виде: чистый текст, субтитры или структура с метками времени для своих скриптов.

TXTSRTJSON
API

Одна команда — и запись в работе

Отправьте файл на POST /v1/audio/transcriptions — эндпоинт совместим с OpenAI, а флаг diarize=true включает разметку по собеседникам.

Документация API
bash · curl
curl -X POST http://ваш-сервер/v1/audio/transcriptions \
  -H "Authorization: Bearer $S2T_API_KEY" \
  -F "file=@interview.mp3" \
  -F "diarize=true" \
  -F "response_format=verbose_json"

Загрузите первую запись

Студия уже развёрнута рядом: эфир, интервью или звонок превратятся в текст, пока вы наливаете кофе.