Tiada muat naik, 100% setempat, tiada akaun

Transkrip Audio, ucapan kepada teks dalam pelayar anda

Letakkan rakaman dan dapatkan transkrip teks. Berjalan pada peranti anda dengan model Whisper kecil yang dimuat turun sekali daripada laman ini; audio anda tidak pernah dimuat naik.

Cara Transkrip Audio · ucapan kepada teks berfungsi

Transkripsi Audio menukar rakaman menjadi teks menggunakan Whisper, model pengecaman pertuturan yang berjalan sepenuhnya dalam tab pelayar anda melalui Transformers.js. Pada kali pertama anda menjalankannya, pelayar anda memuat turun model dan enjin WebAssembly yang diperlukan (kira-kira 68 MB kesemuanya) daripada laman ini, kemudian menyimpannya dalam cache; selepas itu, setiap transkripsi berlaku pada peranti anda tanpa sebarang pelayan dan tanpa audio pernah meninggalkan mesin anda.

Model yang digunakan di sini ialah whisper-tiny.en: varian Whisper yang paling kecil, terkuantisasi dan khusus bahasa Inggeris sahaja. Ia cukup pantas untuk berjalan dalam tab pelayar dan menghasilkan draf pertama yang berguna, tetapi ia bukan perkhidmatan transkripsi profesional. Jangkakan kesilapan pada nama khas, kosa kata teknikal, loghat yang kuat, bunyi latar belakang dan penutur yang bertindih.

Cara menggunakan Transkrip Audio · ucapan kepada teks, langkah demi langkah

  1. Lepaskan fail audio (MP3, WAV, M4A, OGG atau rakaman WebM yang dihasilkan oleh Perakam Suara laman ini) pada kawasan muat naik.
  2. Tunggu muat turun sekali sahaja bagi enjin dan model (kira-kira 68 MB) jika ini transkripsi pertama anda pada peranti ini.
  3. Pilih teks biasa (.txt) atau sari kata bercap masa (.srt) sebagai format output.
  4. Tekan transkripsi dan biarkan Whisper memproses rakaman sepenuhnya dalam tab pelayar anda.

Kes penggunaan biasa

  • Mendapatkan draf tulisan kasar bagi nota suara yang dirakam di telefon sebelum menyuntingnya sendiri.
  • Menukar temu bual pendek yang dirakam menjadi teks yang boleh dicari tanpa memuat naiknya ke perkhidmatan transkripsi awan.
  • Menjana fail sari kata .srt sebagai titik permulaan untuk klip pendek, untuk diperbetulkan kemudian.

Soalan lazim

Sejauh manakah ketepatan transkripsi ini?

Ia sangat bergantung pada kualiti audio. Bahasa Inggeris yang jelas, daripada seorang penutur, dirakam dekat dengan mikrofon dan dengan sedikit bunyi latar belakang, ditranskripsikan dengan agak baik. Loghat yang kuat, suara bertindih, muzik atau bunyi latar belakang serta kosa kata khusus meningkatkan kesilapan. Ini adalah model kecil yang terkuantisasi, dipilih supaya dapat berjalan dalam tab pelayar, jadi anggap hasilnya sebagai draf berguna yang perlu disemak, bukan transkripsi akhir.

Adakah ia berfungsi dengan bahasa selain bahasa Inggeris?

Tidak. Alat ini menggunakan whisper-tiny.en, varian Whisper khusus bahasa Inggeris, yang dipilih kerana ia lebih kecil dan lebih tepat untuk bahasa Inggeris berbanding model tiny berbilang bahasa. Audio dalam bahasa lain akan menghasilkan keputusan yang lemah atau tidak masuk akal.

Adakah audio saya dimuat naik ke mana-mana?

Tidak. Rakaman dinyahkod dan diproses sepenuhnya dalam tab pelayar anda menggunakan Web Audio API dan model Whisper tempatan. Tiada fail audio, dan tiada teks yang ditranskripsikan, pernah dihantar ke pelayan.

Berapa lamakah transkripsi mengambil masa?

Ia bergantung pada CPU peranti anda dan panjang rakaman, kerana semuanya berjalan secara tempatan dan bukan pada perkakasan pelayan. Klip pendek (kurang seminit) biasanya selesai dalam beberapa saat; rakaman panjang, seperti temu bual sejam, mengambil masa yang berkadar lebih lama.