Без завантаження, 100% локально, без облікового запису

Стаття

Сповільнення аудіо для транскрипції

Швидкі мовці, незнайомі акценти та кілька голосів, що накладаються, є трьома основними причинами, через які транскрипція стопориться. Сповільнення запису дає час почути, що було сказано. Але є підступ: наївне сповільнення відтворення також знижує тон кожного голосу, що ускладнює розуміння мовлення, а не полегшує. Ця стаття пояснює різницю між простим зниженням швидкості та розтягненням часу зі збереженням тону, а також охоплює практичні діапазони, які насправді допомагають.

Чому сповільнення допомагає

Людське мовлення несе багато інформації у короткому вікні. Швидкий мовець може вимовляти 200 слів на хвилину або більше, і при такому темпі вухо має мало часу для розбору окремих фонем до приходу наступного складу. Сповільнення аудіо дає мозку більше часу обробки на склад, що найбільш важливо в трьох ситуаціях: мовець з незнайомим акцентом, чиє відображення фонем відрізняється від очікуваного; щільний технічний пасаж, де кожне слово несе значення і одне неправильно почуте слово дає неправильний термін; і записи з двома або більше голосами, що накладаються, де вухо повинно стежити за окремими потоками одночасно. У всіх трьох випадках мета не в тому, щоб почути те, чого не було, а дати собі достатньо часу, щоб точно почути те, що вже записано. Швидкість відтворення 0.75x часто достатня для акценту або щільного пасажу. Швидкість 0.5x корисна для короткого відрізку, де перші кілька прослуховувань не дали розбору слів.

Відображення форми хвилі сегмента мовлення з горизонтально розтягнутою часовою віссю для представлення повільнішого відтворення, межі складів видимі як піки та западини

Швидкість і тон: чому наївне сповільнення не працює

Найпростішим способом сповільнити аудіо є відтворення сэмплів з нижчою швидкістю, ніж вони були записані. Так сповільнювались старі магнітофони: крутите стрічку повільніше, і тривалість, і тон знижуються разом. При 0.75x голоси знижуються приблизно на малу терцію. При 0.5x вони знижуються на цілу октаву. Результатом є знайоме повільне, глибоке спотворення, що робить мовлення неприродним і, як не парадоксально, важчим для розуміння, оскільки форманти, що відрізняють голосні, всі зсунулися вниз. Правильним підходом є розтягнення часу: зміна тривалості аудіо без зміни частот. Тон кожного голосу залишається тим самим; змінюється лише швидкість надходження складів. Це підхід, що використовується інструментом audio-speed та більшістю спеціалізованого програмного забезпечення для транскрипції. Перцептивний результат полягає в тому, що сповільнений запис звучить як той самий мовець, що говорить у повільнішому темпі, що є саме тим, що потрібно, коли мета полягає в точній транскрипції.

Як працює розтягнення часу: підхід atempo

Найбільш широко використовуваним алгоритмом розтягнення часу в практичних аудіоінструментах є алгоритм на основі фазового вокодингу, а його поширеною реалізацією у ffmpeg є фільтр atempo. Вхідне аудіо розбивається на короткі кадри, що перекриваються, зазвичай по 20-40 мілісекунд кожен. Алгоритм аналізує фазові відношення між суміжними кадрами, потім синтезує нові кадри зі зміненою швидкістю, коригуючи фази так, щоб послідовні кадри правильно стикувалися. Результатом є безперервний вихідний сигнал, тривалість якого змінилася, але частотний вміст, ні. Оскільки кадри короткі відносно типового тонального періоду людського голосу, основна частота мовлення зберігається при розтягненні. Побічним ефектом алгоритму є те, що швидкі транзієнти, такі як клацання приголосного, можуть бути трохи розмиті при великому розтягненні, оскільки синтез з перекриванням кадрів вводить невелике усереднення. Це не є дефектом реалізації; це є невід'ємною властивістю сімейства алгоритмів overlap-add.

Діаграма процесу розтягнення часу overlap-add: вхідні аудіокадри зліва, кадри синтезу, що перекриваються, по центру та розтягнута вихідна форма хвилі праворуч

Практичні діапазони швидкості та обмеження якості

Для транскрипційної роботи два значення швидкості охоплюють більшість практичних потреб. При 0.75x мовлення розтягується до 133% своєї початкової тривалості. Кластери приголосних та швидкі переходи голосних стає легше розділяти, а зміна є достатньо малою, щоб алгоритм вводив мінімально помітні артефакти. Більшість слухачів можуть стежити за мовленням при такій швидкості без втрати природного ритму речення. При 0.5x аудіо розтягується до подвійної початкової тривалості. Це корисно для одного речення або короткого важкого пасажу, але це занадто повільно для безперервного прослуховування протягом кількох хвилин; концентрація падає до того, як слова розбираються. Нижче 0.5x якість виводу помітно погіршується. Синтез overlap-add починає вводити тремтіння або фазовість на тривалих голосних, а часові сигнали між приголосними та голосними, що несуть просодію, стають спотвореними. Фільтр atempo у ffmpeg накладає мінімум 0.5x для одного проходу, що відображає це обмеження якості. Значення нижче 0.5x вимагають ланцюжка двох проходів, і рівень артефактів зростає відповідно. Для майже всіх транскрипційних випадків використання, залишаючись при 0.75x або максимум 0.5x для коротких сегментів, виводить чистий, придатний результат.

Локальна робота за допомогою інструменту audio-speed

Інструмент audio-speed на цьому сайті працює повністю у браузері за допомогою ffmpeg, скомпільованого до WebAssembly. Ви кидаєте аудіофайл на сторінку, встановлюєте множник швидкості, і обробка відбувається на вашому пристрої. Запис не покидає вашу машину у жодний момент: без завантаження, без сервера, без стороннього сервісу. Це важливо для записаних розмов, інтерв'ю, медичних диктофонних записів, судових проваджень та будь-якого іншого контексту, де вміст аудіо є конфіденційним. Інструмент приймає поширені аудіоформати, що підтримуються ffmpeg, включаючи MP3, WAV, M4A, OGG та FLAC. Вивід є файлом для завантаження при вибраній швидкості. Оскільки обробка виконується локально, час залежить від тривалості файлу та швидкості пристрою. Кілька хвилин аудіо зазвичай обробляються за значно менше хвилини на сучасному ноутбуці. Інструмент використовує той самий фільтр atempo, описаний у цій статті, тому характеристики якості, описані вище, безпосередньо стосуються того, що ви почуєте у виводі.

Інструменти з цієї статті

Поширені запитання

Чи змінить сповільнення аудіо тон?

Залежить від методу. Просте зниження швидкості відтворення дійсно змінює тон: при 0.5x голоси знижуються на цілу октаву. Інструмент audio-speed використовує розтягнення часу (фільтр atempo), яке змінює тривалість без зміни тону, тому голоси залишаються на оригінальній частоті.

Яка найповільніша швидкість, що звучить чисто?

При 0.75x вивід є чистим для більшості записів. При 0.5x він є прийнятним для коротких пасажів. Нижче 0.5x алгоритм overlap-add починає вводити помітні артефакти на тривалих голосних та переходах приголосних. Для транскрипційної роботи залишання при 0.5x або вище дає найкращі результати.

Чи завантажується файл при використанні інструменту audio-speed?

Ні. Інструмент audio-speed працює повністю у браузері. Файл обробляється локально на вашому пристрої за допомогою WebAssembly. Нічого не надсилається на жоден сервер, тому вміст вашого запису залишається конфіденційним.