无需上传, 100% 本地处理, 无需账户

音频转录,在浏览器中语音转文字

拖入一段录音,获取文字转录稿。模型在你的设备上运行,首次从本站下载一个小型 Whisper 模型;你的音频从不上传。

音频转录 · 语音转文字 的工作原理

音频转录使用 Whisper 语音识别模型,通过 Transformers.js 完全在您的浏览器标签内运行,把一段录音转换成文字。第一次运行时,浏览器会从本站下载所需的模型和 WebAssembly 引擎(总计约 68 MB),然后将其缓存;此后每一次转录都在您的设备上完成,不涉及任何服务器,也不会有任何音频离开您的机器。这与本站 OCR 工具和其他音频工具一样:真实的一次性下载,换来真实的离线处理,而不是一句营销说辞。

这里使用的模型是 whisper-tiny.en:Whisper 系列中最小的、经过量化的纯英语版本。它足够快,可以在浏览器标签内运行,并能生成一份有用的初稿,但它不是专业转录服务。遇到专有名词、专业词汇、浓重口音、背景噪声和多人交叉说话时,预计会出现错误。超过约 30 秒的录音会被拆分为有重叠的片段处理,以确保整个文件都能被转录,但一小时的采访仍然需要真实的计算时间,因为一切都在您自己的设备上运行,而不是在数据中心。

音频转录 · 语音转文字 的分步使用说明

  1. 拖入一个音频文件(MP3、WAV、M4A、OGG,或本站语音录制器生成的 WebM 录音)。
  2. 如果这是您在此设备上的第一次转录,请等待一次性的引擎和模型下载(约 68 MB)。
  3. 选择输出格式:纯文本(.txt)或带时间戳的字幕(.srt)。
  4. 点击转录,让 Whisper 在您的浏览器标签内完整处理这段录音。
  5. 转录完成后,直接复制文字,或下载 .txt/.srt 文件。

常见使用场景

  • 在手动整理之前,先为手机上录制的语音备忘录生成一份粗略的文字草稿。
  • 把一段简短的录音采访转换成可搜索的文字,而不必上传到云端转录服务。
  • 为一段短视频生成一份起始版 .srt 字幕文件,后续再进行修正。
  • 用本站的语音录制器录一段语音笔记,然后在同一个浏览器标签内直接转录。
  • 在不要求完全准确的情况下,为讲座或会议录音获取一份初步文字稿。

常见问题

转录的准确度如何?

这在很大程度上取决于音频质量。靠近麦克风录制、背景噪声较少的清晰单人英语录音,转录效果相对不错。口音、交叉说话、背景音乐或噪声,以及专业词汇(人名、行话、缩写)都会增加错误。这是一个刻意选用的小型量化模型,为的是能在浏览器标签内运行,而不是 Whisper 系列中最大的模型,所以请把输出当作一份需要审阅和修正的有用草稿,而不是最终文稿。

支持英语以外的语言吗?

不支持。此工具使用的是纯英语版本 whisper-tiny.en,之所以选择它,是因为它比多语言版的 tiny 模型体积更小、在英语上更准确。其他语言的音频会产生质量很差甚至无意义的结果。目前尚不支持其他语言。

为什么使用前需要先下载东西?

运行识别所需的语音识别模型和 WebAssembly 引擎(合计约 68 MB)并没有内置在页面中,而是从本站获取一次并由浏览器缓存,这和 OCR 工具下载语言模型的方式类似。完成首次下载后,转录就完全离线运行。不会从任何第三方 CDN 获取任何内容。

我的音频会被上传到任何地方吗?

不会。录音使用 Web Audio API 和本地的 Whisper 模型,完全在您的浏览器标签内解码和处理。没有任何音频文件、也没有任何转录出的文字会被发送到服务器。模型下载完成后,您甚至可以断开网络连接,转录依然可以正常工作。

转录需要多长时间?

这取决于您设备的 CPU 和录音时长,因为一切都在本地运行,而不是在服务器硬件上运行。一分钟以内的短片段通常几秒到不到一分钟就能完成。较长的录音,比如一小时的采访,耗时会成比例增加,并会让您的浏览器标签在这段时间内保持忙碌;请让标签保持打开,处理期间不要跳转到其他页面。

.txt 和 .srt 输出有什么区别?

.txt 文件是不带时间戳的纯转录文字,适合阅读或粘贴到别处。.srt 文件是标准字幕格式,为每个语音片段提供一个时间戳范围,适合为视频添加字幕。两者都由同一次转录生成,选择哪种取决于您接下来要做什么。