Tiada muat naik, 100% setempat, tiada akaun

Transkrip Audio, ucapan kepada teks dalam pelayar anda

Letakkan rakaman dan dapatkan transkrip teks. Berjalan pada peranti anda dengan model Whisper kecil yang dimuat turun sekali daripada laman ini; audio anda tidak pernah dimuat naik.

Cara Transkrip Audio · ucapan kepada teks berfungsi

Transkripsi Audio menukar rakaman menjadi teks menggunakan Whisper, model pengecaman pertuturan yang berjalan sepenuhnya dalam tab pelayar anda melalui Transformers.js. Pada kali pertama anda menjalankannya, pelayar anda memuat turun model dan enjin WebAssembly yang diperlukan (kira-kira 68 MB kesemuanya) daripada laman ini, kemudian menyimpannya dalam cache; selepas itu, setiap transkripsi berlaku pada peranti anda tanpa sebarang pelayan dan tanpa audio pernah meninggalkan mesin anda.

Model yang digunakan di sini ialah whisper-tiny.en: varian Whisper yang paling kecil, terkuantisasi dan khusus bahasa Inggeris sahaja. Ia cukup pantas untuk berjalan dalam tab pelayar dan menghasilkan draf pertama yang berguna, tetapi ia bukan perkhidmatan transkripsi profesional. Jangkakan kesilapan pada nama khas, kosa kata teknikal, loghat yang kuat, bunyi latar belakang dan penutur yang bertindih.

Cara menggunakan Transkrip Audio · ucapan kepada teks, langkah demi langkah

  1. Lepaskan fail audio (MP3, WAV, M4A, OGG atau rakaman WebM yang dihasilkan oleh Perakam Suara laman ini) pada kawasan muat naik.
  2. Tunggu muat turun sekali sahaja bagi enjin dan model (kira-kira 68 MB) jika ini transkripsi pertama anda pada peranti ini.
  3. Pilih teks biasa (.txt) atau sari kata bercap masa (.srt) sebagai format output.
  4. Tekan transkripsi dan biarkan Whisper memproses rakaman sepenuhnya dalam tab pelayar anda.
  5. Salin teks terus di halaman atau muat turun fail .txt/.srt sebaik sahaja ia sedia.

Kes penggunaan biasa

  • Mendapatkan draf tulisan kasar bagi nota suara yang dirakam di telefon sebelum menyuntingnya sendiri.
  • Menukar temu bual pendek yang dirakam menjadi teks yang boleh dicari tanpa memuat naiknya ke perkhidmatan transkripsi awan.
  • Menjana fail sari kata .srt sebagai titik permulaan untuk klip pendek, untuk diperbetulkan kemudian.
  • Merakam nota suara ringkas dengan Perakam Suara laman ini, kemudian mentranskripsikannya dalam tab pelayar yang sama.
  • Mendapatkan transkrip draf pertama bagi rakaman kuliah atau mesyuarat apabila ketepatan sempurna tidak diperlukan.

Soalan lazim

Sejauh manakah ketepatan transkripsi ini?

Ia sangat bergantung pada kualiti audio. Bahasa Inggeris yang jelas, daripada seorang penutur, dirakam dekat dengan mikrofon dan dengan sedikit bunyi latar belakang, ditranskripsikan dengan agak baik. Loghat yang kuat, suara bertindih, muzik atau bunyi latar belakang serta kosa kata khusus meningkatkan kesilapan. Ini adalah model kecil yang terkuantisasi, dipilih supaya dapat berjalan dalam tab pelayar, jadi anggap hasilnya sebagai draf berguna yang perlu disemak, bukan transkripsi akhir.

Adakah ia berfungsi dengan bahasa selain bahasa Inggeris?

Tidak. Alat ini menggunakan whisper-tiny.en, varian Whisper khusus bahasa Inggeris, yang dipilih kerana ia lebih kecil dan lebih tepat untuk bahasa Inggeris berbanding model tiny berbilang bahasa. Audio dalam bahasa lain akan menghasilkan keputusan yang lemah atau tidak masuk akal.

Mengapa ia perlu memuat turun sesuatu sebelum ia berfungsi?

Model pengecaman pertuturan dan enjin WebAssembly yang menjalankannya (kira-kira 68 MB gabungan) tidak dibina terus ke dalam halaman; ia diambil sekali daripada laman ini dan dicache oleh pelayar anda, serupa dengan cara alat OCR memuat turun model bahasa. Selepas muat turun pertama itu, transkripsi berjalan sepenuhnya tanpa talian. Tiada apa-apa diambil daripada mana-mana CDN pihak ketiga.

Adakah audio saya dimuat naik ke mana-mana?

Tidak. Rakaman dinyahkod dan diproses sepenuhnya dalam tab pelayar anda menggunakan Web Audio API dan model Whisper tempatan. Tiada fail audio, dan tiada teks yang ditranskripsikan, pernah dihantar ke pelayan.

Berapa lamakah transkripsi mengambil masa?

Ia bergantung pada CPU peranti anda dan panjang rakaman, kerana semuanya berjalan secara tempatan dan bukan pada perkakasan pelayan. Klip pendek (kurang seminit) biasanya selesai dalam beberapa saat; rakaman panjang, seperti temu bual sejam, mengambil masa yang berkadar lebih lama.

Apakah perbezaan antara output .txt dan .srt?

Fail .txt adalah teks transkripsi biasa tanpa cap masa, berguna untuk dibaca atau ditampal di tempat lain. Fail .srt adalah format sari kata standard dengan julat cap masa untuk setiap segmen pertuturan, berguna untuk menambah kapsyen pada video. Kedua-duanya dihasilkan daripada transkripsi yang sama; pilih mana yang sesuai dengan apa yang perlu anda lakukan seterusnya.