Как работает Расшифровка аудио · речь в текст
Audio Transcribe превращает запись в текст с помощью Whisper, модели распознавания речи, которая полностью работает во вкладке браузера через Transformers.js. При первом запуске браузер загружает с этого сайта модель и необходимый движок WebAssembly (около 68 МБ в сумме), а затем кэширует их; каждая последующая транскрибация происходит на вашем устройстве без участия сервера и без передачи звука куда-либо. Это тот же компромисс, что и у инструментов OCR и аудио на этом сайте: реальная разовая загрузка ради реальной офлайн-обработки, а не маркетинговое заявление.
Используемая здесь модель называется whisper-tiny.en: это самый маленький квантованный вариант Whisper, работающий только с английским языком. Она достаточно быстрая для работы во вкладке браузера и даёт полезный черновой вариант, но не заменяет профессиональную службу транскрибации. Ожидайте ошибок в именах собственных, специальной терминологии, при сильном акценте, фоновом шуме и наложении голосов нескольких говорящих. Записи длиннее примерно 30 секунд обрабатываются перекрывающимися фрагментами, чтобы был транскрибирован весь файл, но часовое интервью всё равно потребует реального времени на вычисления, поскольку всё выполняется на вашем собственном устройстве, а не в дата-центре.