无需上传, 100% 本地处理, 无需账户

文章

减慢音频速度以便转录

说话快、口音陌生和多人同时发言是转录停滞的三个主要原因。减慢录音速度可以争取更多时间来听清内容。问题在于,简单的播放减速也会降低每个人声音的音调,反而使语音更难听懂。本文解释简单减速与保音调时间拉伸的区别,并介绍真正有帮助的实用速度范围。

为什么减速有帮助

人类语音在短时间窗口内携带大量信息。快速说话者每分钟可以说 200 个词甚至更多,在这种速度下,下一个音节到来之前,耳朵几乎没有时间分辨单个音素。减慢音频给大脑提供了更多处理每个音节的时间,在三种情况下尤为重要:口音陌生(音素映射与预期不同)的说话者;每个词都有意义的密集技术段落(听错一个词会产生错误术语);以及两个或多个声音重叠的录音(耳朵需要同时追踪多个流)。在这三种情况下,目标不是听到本来没有的东西,而是给自己足够的时间准确听出已经录制在内的内容。0.75x 的播放速度通常足以应对口音或密集段落。0.5x 适用于前几遍仍未听清的短片段。

波形显示显示一段语音片段,时间轴水平拉伸以表示较慢的播放速度,音节边界以波峰和波谷的形式可见

速度与音调:为什么简单减速不起作用

减慢音频最简单的方法是以低于录制速率的速率播放采样。这就是旧式磁带录音机减速的方式:慢速转动磁带,时长和音调同时降低。以 0.75x 播放,声音会降低约小三度。以 0.5x 播放,会降低整整一个八度。结果是熟悉的缓慢、低沉的失真,使语音听起来不自然,反而更难理解,因为区分元音的共振峰频率都向下移动了。正确的方法是时间拉伸:在不改变频率的情况下改变音频时长。每个声音的音调保持不变,只有音节到来的速率发生变化。这是 audio-speed 工具和大多数专用转录软件使用的方法。感知结果是减速后的录音听起来像同一个说话者以较慢的速度说话,这正是准确转录所需要的。

时间拉伸的工作原理:atempo 方法

实用音频工具中使用最广泛的时间拉伸算法基于相位声码器,其在 ffmpeg 中的常见实现是 atempo 滤镜。输入音频被分割成短的重叠帧,通常每帧 20 到 40 毫秒。算法分析相邻帧之间的相位关系,然后以修改后的速率合成新帧,同时调整相位使连续帧正确对齐。结果是时长已改变但频率内容未变的连续输出信号。由于帧相对于人声的典型音高周期较短,语音的基频在拉伸过程中得以保留。该算法的一个副作用是,当拉伸幅度较大时,辅音点击等快速瞬态可能会略微模糊,因为帧叠加合成引入了少量平均。这不是实现上的缺陷,而是重叠相加算法族的固有属性。

重叠相加时间拉伸过程示意图:左侧为输入音频帧,中间为重叠合成帧,右侧为拉伸后的输出波形

实用速度范围与质量限制

对于转录工作,两个速度值涵盖大多数实际需求。以 0.75x 播放,语音拉伸为原始时长的 133%。辅音群和快速元音转换变得更容易分辨,且变化幅度足够小,算法几乎不引入可感知的伪影。大多数听者能够以这个速度跟随语音而不失去句子的自然节奏。以 0.5x 播放,音频拉伸为原始时长的两倍。这适用于单个句子或短难片段,但不适合连续收听几分钟, 在词语解析出来之前注意力就会下降。低于 0.5x,输出质量会明显下降。重叠相加合成开始在持续元音上引入颤动或相位感,辅音和元音之间承载韵律的时序线索也会失真。ffmpeg 中的 atempo 滤镜规定单次通过的最低值为 0.5x,这反映了这一质量限制。低于 0.5x 的值需要串联两次通过,伪影水平也随之上升。对于几乎所有转录使用场景,在 0.75x 或对短片段最多 0.5x 的范围内操作,能产生干净可用的输出。

使用 audio-speed 工具在本地完成

本站的 audio-speed 工具使用编译为 WebAssembly 的 ffmpeg 完全在浏览器中运行。您将音频文件拖到页面上,设置速度倍数,处理在您的设备上进行。录音不会在任何时候离开您的设备:没有上传,没有服务器,没有第三方服务。这对录制的对话、采访、医疗口述、法律程序以及任何音频内容敏感的场景都很重要。该工具接受 ffmpeg 处理的常见音频格式,包括 MP3、WAV、M4A、OGG 和 FLAC。输出是以您选择的速度生成的可下载文件。由于处理在本地进行,所需时间取决于文件长度和设备速度。在现代笔记本电脑上,几分钟的音频通常在一分钟内完成处理。该工具使用本文描述的相同 atempo 滤镜,因此上文描述的质量特性直接适用于您在输出中听到的内容。

本文涉及的工具

常见问题

减慢音频速度也会改变音调吗?

取决于方法。简单的播放速率降低会改变音调:以 0.5x 播放,声音会降低整整一个八度。audio-speed 工具使用时间拉伸(atempo 滤镜),在改变时长的同时保持音调不变,所以声音保持在原始频率。

最慢能保持清晰的速度是多少?

0.75x 时,大多数录音的输出是干净的。0.5x 时,短片段效果可接受。低于 0.5x,重叠相加算法开始在持续元音和辅音转换上引入可听见的伪影。对于转录工作,保持在 0.5x 或以上能获得最佳结果。

使用 audio-speed 工具时文件会被上传吗?

不会。audio-speed 工具完全在浏览器中运行。文件使用 WebAssembly 在您的设备上本地处理。不向任何服务器发送任何内容,因此您的录音内容保持私密。