音频转录 · 语音转文字 的工作原理
音频转录使用 Whisper 语音识别模型,通过 Transformers.js 完全在您的浏览器标签内运行,把一段录音转换成文字。第一次运行时,浏览器会从本站下载所需的模型和 WebAssembly 引擎(总计约 68 MB),然后将其缓存;此后每一次转录都在您的设备上完成,不涉及任何服务器,也不会有任何音频离开您的机器。这与本站 OCR 工具和其他音频工具一样:真实的一次性下载,换来真实的离线处理,而不是一句营销说辞。
这里使用的模型是 whisper-tiny.en:Whisper 系列中最小的、经过量化的纯英语版本。它足够快,可以在浏览器标签内运行,并能生成一份有用的初稿,但它不是专业转录服务。遇到专有名词、专业词汇、浓重口音、背景噪声和多人交叉说话时,预计会出现错误。超过约 30 秒的录音会被拆分为有重叠的片段处理,以确保整个文件都能被转录,但一小时的采访仍然需要真实的计算时间,因为一切都在您自己的设备上运行,而不是在数据中心。