Không tải lên, 100% cục bộ, không cần tài khoản

Chuyển âm thanh thành văn bản trong trình duyệt

Thả một bản ghi âm và nhận bản chép văn bản. Chạy trên thiết bị của bạn với mô hình Whisper nhỏ gọn tải về một lần từ trang này; âm thanh của bạn không bao giờ được tải lên.

Cách Chuyển âm thanh thành văn bản hoạt động

Audio Transcribe biến một bản ghi âm thành văn bản bằng Whisper, một mô hình nhận dạng giọng nói chạy hoàn toàn trong tab trình duyệt của bạn thông qua Transformers.js. Lần đầu tiên bạn chạy công cụ, trình duyệt sẽ tải xuống mô hình và engine WebAssembly cần thiết (khoảng 68 MB tổng cộng) từ trang này, sau đó lưu vào bộ nhớ đệm; mọi lần chuyển thành văn bản sau đó đều diễn ra trên thiết bị của bạn mà không cần máy chủ nào và không có âm thanh nào rời khỏi máy của bạn. Đó là đánh đổi giống với công cụ OCR và các công cụ âm thanh khác trên trang này: một lần tải xuống thật sự để đổi lấy xử lý ngoại tuyến thật sự, không phải một lời quảng cáo suông.

Mô hình được dùng ở đây là whisper-tiny.en: phiên bản Whisper nhỏ nhất, đã lượng tử hóa, chỉ dành cho tiếng Anh. Nó đủ nhanh để chạy trong một tab trình duyệt và cho ra bản nháp đầu tiên hữu ích, nhưng đây không phải là dịch vụ phiên âm chuyên nghiệp. Hãy lường trước sai sót với tên riêng, thuật ngữ kỹ thuật, giọng địa phương nặng, tiếng ồn nền và nhiều người nói chồng lời nhau. Các bản ghi dài hơn khoảng 30 giây được xử lý theo từng đoạn chồng lấn để toàn bộ tệp được chuyển thành văn bản, nhưng một cuộc phỏng vấn dài một giờ vẫn cần thời gian tính toán thực sự vì mọi thứ chạy trên chính thiết bị của bạn thay vì trên một trung tâm dữ liệu.

Cách sử dụng Chuyển âm thanh thành văn bản, từng bước

  1. Thả một tệp âm thanh (MP3, WAV, M4A, OGG hoặc bản ghi WebM do Voice Recorder của trang này tạo ra).
  2. Đợi engine và mô hình tải xuống một lần duy nhất (khoảng 68 MB) nếu đây là lần đầu bạn chuyển đổi trên thiết bị này.
  3. Chọn văn bản thuần túy (.txt) hoặc phụ đề có dấu thời gian (.srt) làm định dạng đầu ra.
  4. Nhấn chuyển đổi và để Whisper xử lý bản ghi hoàn toàn trong tab trình duyệt của bạn.
  5. Sao chép văn bản trực tiếp hoặc tải xuống tệp .txt/.srt khi đã sẵn sàng.

Trường hợp sử dụng thường gặp

  • Lấy bản nháp viết sơ bộ của một ghi chú thoại được ghi trên điện thoại trước khi chỉnh sửa thủ công.
  • Biến một cuộc phỏng vấn ngắn đã ghi âm thành văn bản có thể tìm kiếm mà không cần tải lên dịch vụ phiên âm đám mây.
  • Tạo tệp phụ đề .srt khởi điểm cho một đoạn clip ngắn, để chỉnh sửa lại sau.
  • Ghi một ghi chú thoại nhanh bằng Voice Recorder của trang này, rồi chuyển đổi ngay trong cùng tab trình duyệt.
  • Lấy bản phiên âm sơ bộ của một bài giảng hay cuộc họp được ghi âm khi không cần độ chính xác hoàn hảo.

Câu hỏi thường gặp

Độ chính xác của bản phiên âm ra sao?

Điều này phụ thuộc rất nhiều vào chất lượng âm thanh. Bản ghi tiếng Anh rõ ràng, một người nói, thu gần micro với ít tiếng ồn nền sẽ được chuyển đổi khá tốt. Giọng địa phương, nhiều người nói chồng lời, nhạc hoặc tiếng ồn nền, và từ vựng chuyên ngành (tên riêng, thuật ngữ, từ viết tắt) đều làm tăng lỗi. Đây là một mô hình nhỏ, đã lượng tử hóa được chọn để có thể chạy trong tab trình duyệt, không phải mô hình Whisper lớn nhất, vì vậy hãy xem kết quả như một bản nháp hữu ích cần xem lại và sửa, không phải bản phiên âm cuối cùng.

Công cụ có hoạt động với ngôn ngữ khác ngoài tiếng Anh không?

Không. Công cụ này dùng whisper-tiny.en, phiên bản Whisper chỉ dành cho tiếng Anh, được chọn vì nó nhỏ hơn và chính xác hơn trên tiếng Anh so với mô hình tiny đa ngôn ngữ. Âm thanh bằng ngôn ngữ khác sẽ cho kết quả kém hoặc vô nghĩa. Hiện chưa hỗ trợ các ngôn ngữ khác.

Tại sao công cụ cần tải xuống thứ gì đó trước khi hoạt động?

Mô hình nhận dạng giọng nói và engine WebAssembly chạy nó (tổng cộng khoảng 68 MB) không được đóng gói sẵn trong trang; chúng được tải xuống một lần từ trang này và được trình duyệt của bạn lưu vào bộ nhớ đệm, tương tự cách công cụ OCR tải xuống gói ngôn ngữ. Sau lần tải đầu tiên đó, việc chuyển đổi chạy hoàn toàn ngoại tuyến. Không có gì được tải từ bất kỳ CDN bên thứ ba nào.

Âm thanh của tôi có bị tải lên đâu không?

Không. Bản ghi được giải mã và xử lý hoàn toàn trong tab trình duyệt của bạn bằng Web Audio API và một mô hình Whisper cục bộ. Không tệp âm thanh nào, và không văn bản phiên âm nào, từng được gửi đến máy chủ. Bạn có thể ngắt kết nối mạng sau khi mô hình đã tải xuống và việc chuyển đổi vẫn hoạt động.

Việc chuyển đổi mất bao lâu?

Điều này phụ thuộc vào CPU của thiết bị bạn và độ dài bản ghi, vì mọi thứ chạy cục bộ thay vì trên phần cứng máy chủ. Các đoạn ngắn (dưới một phút) thường hoàn thành trong vài giây đến dưới một phút. Bản ghi dài, chẳng hạn một cuộc phỏng vấn một giờ, sẽ mất thời gian tương ứng lâu hơn và khiến tab trình duyệt của bạn bận trong suốt thời gian đó; hãy giữ tab mở và không điều hướng đi nơi khác trong khi nó xử lý.

Sự khác biệt giữa đầu ra .txt và .srt là gì?

Tệp .txt là văn bản phiên âm thuần túy không có dấu thời gian, hữu ích để đọc hoặc dán vào nơi khác. Tệp .srt là định dạng phụ đề chuẩn với khoảng thời gian cho mỗi đoạn nói, hữu ích để thêm phụ đề vào video. Cả hai đều được tạo từ cùng một bản phiên âm; chọn định dạng phù hợp với việc bạn cần làm tiếp theo.