Точность Whisper large-v3-turbo
Свежая модель Whisper уверенно распознаёт русскую речь — с беглыми репликами, именами и терминами — и сама расставляет пунктуацию.
Speech2Text расшифровывает русскую речь на Whisper large-v3-turbo и разделяет собеседников по голосам. Загрузите эфир, интервью или запись опроса — получите текст диалога с тайм-кодами.
Whisper large-v3-turbo · GPU · Диаризация
Без облачных подписок и лишних настроек: загрузили запись — получили текст, который можно сразу отдавать в работу.
Свежая модель Whisper уверенно распознаёт русскую речь — с беглыми репликами, именами и терминами — и сама расставляет пунктуацию.
Диаризация помечает, кто говорит: на выходе — готовый текст диалога с репликами «Собеседник 1», «Собеседник 2» и далее.
Распознавание идёт на GPU, поэтому запись расшифровывается быстрее, чем звучит. Очередь заданий видна в студии.
Пословные метки времени и готовый файл SRT: легко найти нужную цитату в записи и собрать субтитры к видео.
Обычный REST плюс OpenAI-совместимый эндпоинт: клиенты и скрипты, написанные под облачный API, подключаются без переделки.
Сервис развёрнут на вашем сервере: записи и расшифровки не покидают редакцию и не уходят во внешние облака.
Порядок всегда один и тот же — в студии и по API.
Перетащите файл в студию или отправьте его по API. Подходят аудио и видео в привычных форматах.
Whisper расшифровывает речь на GPU, диаризация раскладывает реплики по голосам и проставляет тайм-коды.
Скачайте расшифровку в удобном виде: чистый текст, субтитры или структура с метками времени для своих скриптов.
Отправьте файл на POST /v1/audio/transcriptions —
эндпоинт совместим с OpenAI, а флаг diarize=true
включает разметку по собеседникам.
curl -X POST http://ваш-сервер/v1/audio/transcriptions \
-H "Authorization: Bearer $S2T_API_KEY" \
-F "file=@interview.mp3" \
-F "diarize=true" \
-F "response_format=verbose_json"
Студия уже развёрнута рядом: эфир, интервью или звонок превратятся в текст, пока вы наливаете кофе.