Cara kerja Transkripsi Audio · ucapan ke teks
Transkripsi Audio mengubah rekaman menjadi teks menggunakan Whisper, model pengenalan ucapan yang berjalan sepenuhnya di dalam tab browser Anda lewat Transformers.js. Saat pertama kali Anda menjalankannya, browser Anda mengunduh model dan mesin WebAssembly yang dibutuhkannya (total sekitar 68 MB) dari situs ini, lalu menyimpannya di cache; setiap transkripsi setelahnya berjalan di perangkat Anda tanpa melibatkan server dan tanpa audio apa pun yang pernah meninggalkan mesin Anda. Ini adalah trade-off yang sama seperti alat OCR dan alat audio lain di situs ini: unduhan satu kali yang sungguhan untuk pemrosesan offline yang sungguhan, bukan klaim pemasaran.
Model yang dipakai di sini adalah whisper-tiny.en: varian Whisper terkecil, terkuantisasi, dan khusus bahasa Inggris. Model ini cukup cepat untuk dijalankan di tab browser dan menghasilkan draf awal yang berguna, tetapi ini bukan layanan transkripsi profesional. Perkirakan akan ada kesalahan pada nama diri, kosakata teknis, aksen kuat, suara latar, dan pembicara yang bertumpang tindih. Rekaman yang lebih panjang dari sekitar 30 detik diproses dalam potongan yang saling tumpang tindih agar seluruh file tetap ditranskripsi, tetapi wawancara satu jam tetap membutuhkan waktu komputasi yang nyata karena semuanya berjalan di perangkat Anda sendiri, bukan di pusat data.