Без завантаження, 100% локально, без облікового запису

Розшифрування аудіо, мова в текст у браузері

Перетягніть запис і отримайте текстову розшифровку. Працює на вашому пристрої з невеликою моделлю Whisper, що завантажується один раз із цього сайту; ваше аудіо ніколи не надсилається на сервер.

Як працює Розшифрування аудіо · мова в текст

Транскрибування аудіо перетворює запис на текст за допомогою Whisper, моделі розпізнавання мовлення, яка повністю працює у вкладці вашого браузера через Transformers.js. Під час першого запуску браузер завантажує з цього сайту модель і потрібний механізм WebAssembly (загалом близько 68 МБ), а потім кешує їх; кожне наступне транскрибування відбувається на вашому пристрої без сервера і без того, щоб аудіо коли-небудь покидало ваш комп'ютер. Це той самий компроміс, що й в інструментах OCR та аудіо на цьому сайті: реальне одноразове завантаження заради реальної офлайн-обробки, а не маркетингове твердження.

Тут використовується модель whisper-tiny.en: найменший, квантизований варіант Whisper лише для англійської мови. Вона достатньо швидка, щоб працювати у вкладці браузера, і дає корисний перший чорновий варіант, але це не професійний сервіс транскрибування. Очікуйте помилок у власних назвах, технічній лексиці, за сильного акценту, фонового шуму та накладання голосів кількох людей. Записи, довші за приблизно 30 секунд, обробляються фрагментами, що перекриваються, щоб транскрибувати весь файл, але навіть за такого підходу годинне інтерв'ю все одно вимагає реального обчислювального часу, оскільки все виконується на вашому власному пристрої, а не в дата-центрі.

Розшифрування аудіо · мова в текст: покрокова інструкція

  1. Перетягніть аудіофайл (MP3, WAV, M4A, OGG або записи WebM, які створює диктофон цього сайту).
  2. Зачекайте на одноразове завантаження механізму й моделі (близько 68 МБ), якщо це ваше перше транскрибування на цьому пристрої.
  3. Оберіть простий текст (.txt) або субтитри з позначками часу (.srt) як формат виводу.
  4. Натисніть «Транскрибувати» і дозвольте Whisper повністю обробити запис у вкладці вашого браузера.
  5. Скопіюйте текст безпосередньо або завантажте файл .txt/.srt, коли він буде готовий.

Поширені сценарії використання

  • Отримання приблизного письмового чорновика голосової нотатки, записаної на телефоні, перед ручним доопрацюванням.
  • Перетворення короткого записаного інтерв'ю на текст із можливістю пошуку без завантаження до хмарного сервісу транскрибування.
  • Створення початкового файлу субтитрів .srt для короткого відео, який потім буде виправлено.
  • Запис короткої голосової нотатки за допомогою диктофона цього сайту з подальшим транскрибуванням у тій самій вкладці браузера.
  • Отримання первинного транскрипту запису лекції чи наради, коли ідеальна точність не потрібна.

Поширені запитання

Наскільки точним є транскрибування?

Це значною мірою залежить від якості звуку. Чітка англійська мова одного мовця, записана близько до мікрофона з невеликим фоновим шумом, транскрибується досить добре. Акценти, накладання голосів, фонова музика чи шум і спеціалізована лексика (імена, жаргон, абревіатури) збільшують кількість помилок. Це невелика, квантизована модель, обрана саме для того, щоб працювати у вкладці браузера, а не найбільша модель Whisper, тож ставтеся до результату як до корисного чорновика для перевірки й виправлення, а не як до остаточного транскрипту.

Чи працює це з мовами, відмінними від англійської?

Ні. Цей інструмент використовує whisper-tiny.en, варіант Whisper лише для англійської мови, обраний тому, що він менший і точніший для англійської, ніж багатомовна маленька модель. Аудіо іншими мовами дасть погані або беззмістовні результати. Підтримка інших мов наразі недоступна.

Чому потрібно щось завантажити, перш ніж це запрацює?

Модель розпізнавання мовлення та механізм WebAssembly, що її запускає (разом близько 68 МБ), не вбудовані в сторінку; вони одноразово завантажуються з цього сайту й кешуються браузером, подібно до того, як інструмент OCR завантажує мовну модель. Після цього першого завантаження транскрибування працює повністю офлайн. Нічого не завантажується з жодної сторонньої CDN.

Чи завантажується моє аудіо кудись?

Ні. Запис декодується й обробляється повністю у вкладці вашого браузера за допомогою Web Audio API та локальної моделі Whisper. Жоден аудіофайл і жоден транскрибований текст ніколи не надсилаються на сервер. Ви можете відключитися від мережі після завантаження моделі: транскрибування все одно працюватиме.

Скільки часу займає транскрибування?

Це залежить від процесора вашого пристрою й тривалості запису, оскільки все виконується локально, а не на серверному обладнанні. Короткі кліпи (до хвилини) зазвичай завершуються за кілька секунд, менше хвилини. Довгі записи, наприклад годинне інтерв'ю, займають пропорційно більше часу й займатимуть вкладку браузера протягом усього цього часу; тримайте вкладку відкритою і не переходьте на іншу сторінку, поки триває обробка.

У чому різниця між виводом .txt і .srt?

Файл .txt є простим транскрибованим текстом без позначок часу, зручним для читання чи вставлення в інше місце. Файл .srt є стандартним форматом субтитрів із діапазоном позначок часу для кожного мовленнєвого сегмента, зручним для додавання субтитрів до відео. Обидва створюються з одного й того самого транскрибування; оберіть той, що відповідає вашій наступній задачі.