Как работи Разпознаване на реч · аудио в текст
Audio Transcribe превръща запис в текст с помощта на Whisper, модел за разпознаване на реч, който работи изцяло в раздела на браузъра ви чрез Transformers.js. При първото стартиране браузърът ви изтегля модела и необходимия WebAssembly механизъм (общо около 68 MB) от този сайт, след което ги кешира; всяка следваща транскрипция се случва на вашето устройство, без сървър и без аудиото да напуска машината ви. Това е същият компромис, както при инструментите за OCR и аудио на този сайт: реално еднократно изтегляне за реална офлайн обработка, а не маркетингово твърдение.
Използваният тук модел е whisper-tiny.en: най-малкият, квантован, само за английски вариант на Whisper. Достатъчно бърз е, за да работи в раздел на браузъра, и произвежда полезна първа чернова, но не е професионална услуга за транскрипция. Очаквайте грешки при собствени имена, техническа лексика, силни акценти, фонов шум и застъпващи се говорители. Записи, по-дълги от около 30 секунди, се обработват на застъпващи се сегменти, за да бъде транскрибиран целият файл, но едночасово интервю все пак отнема реално изчислително време, тъй като всичко се изпълнява на вашето собствено устройство, а не в център за данни.