Без качване, 100% локално, без акаунт

Статия

Забавяне на аудио за транскрипция

Бързи говорещи, непознати акценти и множество припокриващи се гласове са трите основни причини транскрипцията да заседне. Забавянето на записа дава време да уловите казаното. Уловката е, че наивното забавяне на възпроизвеждането също понижава тоналността на всеки глас, което прави речта по-трудна за проследяване, а не по-лесна. Тази статия обяснява разликата между простото намаляване на скоростта и разтягането на времето с запазване на тона, и обхваща практическите диапазони, които действително помагат.

Защо забавянето помага

Човешката реч носи много информация в кратък прозорец. Бърз говорещ може да произнася 200 или повече думи в минута, и при тази скорост ухото има малко време да разграничи отделните фонеми, преди да пристигне следващата сричка. Забавянето на аудиото дава на мозъка повече процесорно време на сричка, което е най-важно в три ситуации: говорещ с непознат акцент, чието фонемно съответствие се различава от очакваното; плътен технически пасаж, където всяка дума носи смисъл и едно погрешно чуване произвежда грешен термин; и записи с два или повече припокриващи се гласове, при които ухото трябва да следва отделни потоци едновременно. И в трите случая целта не е да чуете нещо, което не е там, а да си дадете достатъчно време да чуете точно това, което вече е записано. Скорост 0.75x е често достатъчна за акцент или плътен пасаж. Скорост 0.5x е полезна за кратък раздел, при който първите няколко прохода не са разграничили думите.

Дисплей с форма на вълната, показващ сегмент от реч, с ос на времето, разтегната хоризонтално, за да представи по-бавно възпроизвеждане, с граници на сричките, видими като върхове и долини

Скорост и тоналност: защо наивното забавяне не работи

Най-простият начин за забавяне на аудио е да се възпроизвеждат семплите с по-ниска скорост от тази, с която са записани. Така забавяха старите магнетофони: завъртете лентата по-бавно и и продължителността, и тоналността падат заедно. При 0.75x, гласовете падат с около малка терца. При 0.5x, те падат с цяла октава. Резултатът е познатото бавно, дълбоко изкривяване, което прави речта ненатурална и, парадоксално, по-трудна за разбиране, защото формантните честоти, разграничаващи гласните, са се изместили надолу. Правилният подход е разтягане на времето: промяна на продължителността на аудиото без промяна на честотите. Тоналността на всеки глас остава същата; само скоростта, с която пристигат сричките, се променя. Това е подходът, използван от инструмента audio-speed и от повечето специализирани софтуер за транскрипция. Перцептуалният резултат е, че забавеният запис звучи като същия говорещ, говорещ с по-бавно темпо, което е точно необходимото, когато целта е точна транскрипция.

Как работи разтягането на времето: подходът atempo

Най-широко използваният алгоритъм за разтягане на времето в практически аудио инструменти се основава на фазово вокодиране, а общата му имплементация в ffmpeg е филтърът atempo. Входното аудио се разделя на кратки припокриващи се рамки, обикновено от 20 до 40 милисекунди всяка. Алгоритъмът анализира фазовите взаимоотношения между съседни рамки, след което синтезира нови рамки с модифицирана скорост, като настройва фазите, така че последователните рамки да се наредят правилно. Резултатът е непрекъснат изходен сигнал, чиято продължителност се е променила, но чието честотно съдържание не. Тъй като рамките са кратки спрямо типичния период на тона на човешки глас, основната честота на речта се запазва при разтягането. Един страничен ефект на алгоритъма е, че бързи преходи, като щракването на съгласна, могат да бъдат леко размазани при голямо разтягане, защото синтезът с припокриване на рамки въвежда малко усредняване. Това не е дефект в имплементацията; то е неотменимо свойство на семейството алгоритми с припокриване и добавяне.

Диаграма на процеса за разтягане на времето с припокриване и добавяне: входни аудио рамки вляво, припокриващи се синтезни рамки в центъра и разтегнатата изходна форма на вълната вдясно

Практически диапазони на скоростта и ограничения на качеството

За транскрипционна работа, две стойности на скоростта покриват повечето практически нужди. При 0.75x, речта се разтяга до 133% от оригиналната си продължителност. Клъстерите от съгласни и бързите преходи на гласни стават по-лесни за разграничаване, а промяната е достатъчно малка, че алгоритъмът въвежда много малко забележими артефакти. Повечето слушатели могат да следят речта с тази скорост, без да губят естествения ритъм на изречението. При 0.5x, аудиото се разтяга до двойна оригинална дължина. Това е полезно за едно изречение или кратък труден пасаж, но е твърде бавно за непрекъснато слушане в продължение на няколко минути; концентрацията пада преди думите да бъдат разграничени. Под 0.5x, качеството на изхода се влошава забележително. Синтезът с припокриване и добавяне започва да въвежда трептене или фазовост при продължителни гласни, а времевите сигнали между съгласни и гласни, носещи просодия, се изкривяват. Филтърът atempo в ffmpeg налага минимум от 0.5x за един проход, което отразява това ограничение за качество. Стойности под 0.5x изискват верижно свързване на два прохода, а нивото на артефактите нараства съответно. За почти всички случаи на транскрипция, оставането при 0.75x или най-много 0.5x за кратки сегменти произвежда чист, използваем изход.

Правете го локално с инструмента audio-speed

Инструментът audio-speed на този сайт работи изцяло в браузъра с ffmpeg, компилиран до WebAssembly. Пускате аудио файла на страницата, задавате множителя на скоростта и обработката се извършва на устройството ви. Записът не напуска машината ви в нито един момент: без качване, без сървър, без услуга на трета страна. Това е важно за записани разговори, интервюта, медицински диктовки, правни производства и всеки друг контекст, в който съдържанието на аудиото е чувствително. Инструментът приема честите аудио формати, обработвани от ffmpeg, включително MP3, WAV, M4A, OGG и FLAC. Изходът е изтеглим файл с избраната от вас скорост. Тъй като обработката се изпълнява локално, времето зависи от дължината на файла и скоростта на устройството ви. Няколко минути аудио обикновено се обработват за по-малко от минута на модерен лаптоп. Инструментът използва същия филтър atempo, описан в тази статия, така че характеристиките на качеството, описани по-горе, се прилагат директно за това, което ще чуете в изхода.

Инструменти от тази статия

Често задавани въпроси

Ще промени ли забавянето на аудио тоналността?

Зависи от метода. Простото намаляване на скоростта на възпроизвеждане променя тоналността: при 0.5x, гласовете падат с цяла октава. Инструментът audio-speed използва разтягане на времето (филтъра atempo), което променя продължителността без промяна на тоналността, така че гласовете остават на оригиналната си честота.

Каква е най-бавната скорост, която все още звучи чисто?

При 0.75x изходът е чист за повечето записи. При 0.5x е приемлив за кратки пасажи. Под 0.5x, алгоритъмът с припокриване и добавяне започва да въвежда чуваеми артефакти при продължителни гласни и преходи на съгласни. За транскрипционна работа, оставането при или над 0.5x дава най-добри резултати.

Качва ли се файлът при използване на инструмента audio-speed?

Не. Инструментът audio-speed работи изцяло в браузъра. Файлът се обработва локално на устройството ви с WebAssembly. Нищо не се изпраща до сървър, така че съдържанието на записа ви остава поверително.