Як працює Розшифрування аудіо · мова в текст
Транскрибування аудіо перетворює запис на текст за допомогою Whisper, моделі розпізнавання мовлення, яка повністю працює у вкладці вашого браузера через Transformers.js. Під час першого запуску браузер завантажує з цього сайту модель і потрібний механізм WebAssembly (загалом близько 68 МБ), а потім кешує їх; кожне наступне транскрибування відбувається на вашому пристрої без сервера і без того, щоб аудіо коли-небудь покидало ваш комп'ютер. Це той самий компроміс, що й в інструментах OCR та аудіо на цьому сайті: реальне одноразове завантаження заради реальної офлайн-обробки, а не маркетингове твердження.
Тут використовується модель whisper-tiny.en: найменший, квантизований варіант Whisper лише для англійської мови. Вона достатньо швидка, щоб працювати у вкладці браузера, і дає корисний перший чорновий варіант, але це не професійний сервіс транскрибування. Очікуйте помилок у власних назвах, технічній лексиці, за сильного акценту, фонового шуму та накладання голосів кількох людей. Записи, довші за приблизно 30 секунд, обробляються фрагментами, що перекриваються, щоб транскрибувати весь файл, але навіть за такого підходу годинне інтерв'ю все одно вимагає реального обчислювального часу, оскільки все виконується на вашому власному пристрої, а не в дата-центрі.