Без загрузки, 100% локально, без аккаунта

Статья

Замедление аудио для транскрипции

Быстрые дикторы, незнакомые акценты и несколько перекрывающихся голосов, три основные причины, по которым транскрипция зависает. Замедление записи даёт время расслышать то, что было сказано. Но простое замедление воспроизведения также понижает тон каждого голоса, что делает речь труднее для восприятия, а не легче. В этой статье объясняется разница между простым уменьшением скорости и растяжением времени с сохранением тона, а также рассматриваются практические диапазоны, которые действительно помогают.

Почему замедление помогает

Человеческая речь несёт много информации в короткий промежуток времени. Быстрый диктор может произносить 200 слов в минуту и более, и при такой скорости у слуха мало времени, чтобы разобрать отдельные фонемы до прихода следующего слога. Замедление аудио даёт мозгу больше времени обработки на слог, что важнее всего в трёх ситуациях: диктор с незнакомым акцентом, чьё отображение фонем отличается от ожидаемого; плотный технический пассаж, где каждое слово несёт смысл и одна ошибка даёт неверный термин; записи с двумя и более перекрывающимися голосами, где слуху нужно отслеживать отдельные потоки одновременно. Во всех трёх случаях цель не в том, чтобы услышать то, чего нет, а в том, чтобы дать себе достаточно времени точно расслышать уже записанное. Скорость воспроизведения 0.75x часто достаточна для акцента или плотного пассажа. Скорость 0.5x полезна для короткого отрезка, где первые несколько прослушиваний не позволили разобрать слова.

Отображение формы волны с сегментом речи, с горизонтально растянутой осью времени для представления замедленного воспроизведения, границы слогов видны как пики и впадины

Скорость и тон: почему простое замедление не работает

Простейший способ замедлить аудио, воспроизводить образцы с более низкой частотой, чем они были записаны. Именно так старые магнитофоны замедляли запись: прокрутить ленту медленнее, и одновременно падают и длительность, и тон. При 0.75x голоса понижаются примерно на малую терцию. При 0.5x, на целую октаву. Результатом является знакомое медленное глубокое искажение, которое делает речь неестественной и, как ни парадоксально, труднее для понимания, поскольку формантные частоты, различающие гласные, все сместились вниз. Правильный подход, растяжение времени: изменение длительности аудио без изменения частот. Тон каждого голоса остаётся прежним, меняется только скорость появления слогов. Именно этот подход используется в инструменте audio-speed и в большинстве специализированных программ для транскрипции. Перцептивный результат: замедленная запись звучит как тот же говорящий, говорящий медленнее, что именно и нужно для точной транскрипции.

Как работает растяжение времени: подход atempo

Наиболее широко используемый алгоритм растяжения времени в практических аудиоинструментах основан на фазовом вокодировании, и его распространённая реализация в ffmpeg, фильтр atempo. Входное аудио разбивается на короткие перекрывающиеся фреймы, обычно от 20 до 40 миллисекунд каждый. Алгоритм анализирует фазовые соотношения между соседними фреймами, затем синтезирует новые фреймы с изменённой скоростью, корректируя фазы так, чтобы последовательные фреймы стыковались правильно. Результатом является непрерывный выходной сигнал, длительность которого изменилась, но частотное содержимое не изменилось. Поскольку фреймы короткие относительно типичного периода тона человеческого голоса, основная частота речи сохраняется при растяжении. Один побочный эффект алгоритма: быстрые переходы, такие как щелчок согласного, могут быть немного размытыми при большом растяжении, поскольку синтез с перекрытием фреймов вносит небольшое усреднение. Это не недостаток реализации, а присущее свойство семейства алгоритмов с перекрытием и добавлением.

Диаграмма процесса растяжения времени с перекрытием: входные аудиофреймы слева, перекрывающиеся синтезные фреймы в центре и растянутая выходная форма волны справа

Практические диапазоны скорости и ограничения качества

Для работы с транскрипцией два значения скорости охватывают большинство практических потребностей. При 0.75x речь растягивается до 133% исходной длительности. Кластеры согласных и быстрые гласные переходы становятся легче разделить, а изменение достаточно мало, чтобы алгоритм вносил минимальный воспринимаемый артефакт. Большинство слушателей могут следить за речью с такой скоростью, не теряя естественного ритма предложения. При 0.5x аудио растягивается до двойной исходной длины. Это полезно для одного предложения или короткого сложного пассажа, но слишком медленно для непрерывного прослушивания в течение нескольких минут: концентрация падает до того, как слова разбираются. Ниже 0.5x качество вывода заметно ухудшается. Синтез с перекрытием начинает вносить дрожание или фазовость на длительных гласных, а временные подсказки между согласными и гласными, несущие просодию, искажаются. Фильтр atempo в ffmpeg устанавливает минимум 0.5x для одного прохода, что отражает это ограничение качества. Значения ниже 0.5x требуют соединения двух проходов, и уровень артефактов соответственно растёт. Для почти всех случаев транскрипции значения 0.75x или максимум 0.5x для коротких сегментов дают чистый и пригодный результат.

Локальная работа с инструментом audio-speed

Инструмент audio-speed на этом сайте работает полностью в браузере, используя ffmpeg, скомпилированный в WebAssembly. Вы перетаскиваете аудиофайл на страницу, устанавливаете множитель скорости, и обработка происходит на вашем устройстве. Запись не покидает вашу машину ни в какой момент: нет загрузки, нет сервера, нет сторонних сервисов. Это важно для записанных разговоров, интервью, медицинских диктовок, судебных разбирательств и любого другого контекста, где содержимое аудио является конфиденциальным. Инструмент принимает распространённые аудиоформаты, поддерживаемые ffmpeg, включая MP3, WAV, M4A, OGG и FLAC. Результатом является файл для скачивания со скоростью, которую вы выбрали. Поскольку обработка выполняется локально, затрачиваемое время зависит от длины файла и скорости вашего устройства. Несколько минут аудио обычно обрабатываются менее чем за минуту на современном ноутбуке. Инструмент использует тот же фильтр atempo, описанный в этой статье, поэтому характеристики качества, описанные выше, напрямую применимы к тому, что вы услышите в результате.

Инструменты из этой статьи

Частые вопросы

Изменит ли замедление аудио также и тон?

Это зависит от метода. Простое снижение скорости воспроизведения действительно изменяет тон: при 0.5x голоса понижаются на целую октаву. Инструмент audio-speed использует растяжение времени (фильтр atempo), которое изменяет длительность без изменения тона, поэтому голоса остаются на исходной частоте.

Какая наименьшая скорость звучит чисто?

При 0.75x результат чистый для большинства записей. При 0.5x он приемлем для коротких пассажей. Ниже 0.5x алгоритм с перекрытием начинает вносить слышимые артефакты на длительных гласных и переходах согласных. Для работы с транскрипцией значения 0.5x и выше дают наилучшие результаты.

Загружается ли файл при использовании инструмента audio-speed?

Нет. Инструмент audio-speed работает полностью в браузере. Файл обрабатывается локально на вашем устройстве с использованием WebAssembly. Ничего не отправляется ни на какой сервер, поэтому содержимое вашей записи остаётся конфиденциальным.