Tanpa unggah, 100% lokal, tanpa akun

Transkripsi Audio, ucapan ke teks di browser Anda

Jatuhkan rekaman dan dapatkan transkrip teks. Berjalan di perangkat Anda dengan model Whisper kecil yang diunduh sekali dari situs ini; audio Anda tidak pernah diunggah.

Cara kerja Transkripsi Audio · ucapan ke teks

Transkripsi Audio mengubah rekaman menjadi teks menggunakan Whisper, model pengenalan ucapan yang berjalan sepenuhnya di dalam tab browser Anda lewat Transformers.js. Saat pertama kali Anda menjalankannya, browser Anda mengunduh model dan mesin WebAssembly yang dibutuhkannya (total sekitar 68 MB) dari situs ini, lalu menyimpannya di cache; setiap transkripsi setelahnya berjalan di perangkat Anda tanpa melibatkan server dan tanpa audio apa pun yang pernah meninggalkan mesin Anda. Ini adalah trade-off yang sama seperti alat OCR dan alat audio lain di situs ini: unduhan satu kali yang sungguhan untuk pemrosesan offline yang sungguhan, bukan klaim pemasaran.

Model yang dipakai di sini adalah whisper-tiny.en: varian Whisper terkecil, terkuantisasi, dan khusus bahasa Inggris. Model ini cukup cepat untuk dijalankan di tab browser dan menghasilkan draf awal yang berguna, tetapi ini bukan layanan transkripsi profesional. Perkirakan akan ada kesalahan pada nama diri, kosakata teknis, aksen kuat, suara latar, dan pembicara yang bertumpang tindih. Rekaman yang lebih panjang dari sekitar 30 detik diproses dalam potongan yang saling tumpang tindih agar seluruh file tetap ditranskripsi, tetapi wawancara satu jam tetap membutuhkan waktu komputasi yang nyata karena semuanya berjalan di perangkat Anda sendiri, bukan di pusat data.

Cara menggunakan Transkripsi Audio · ucapan ke teks, langkah demi langkah

  1. Jatuhkan file audio (MP3, WAV, M4A, OGG, atau rekaman WebM yang dihasilkan Voice Recorder situs ini).
  2. Tunggu unduhan mesin dan model satu kali (sekitar 68 MB) jika ini transkripsi pertama Anda di perangkat ini.
  3. Pilih teks biasa (.txt) atau subtitle berstempel waktu (.srt) sebagai format keluaran.
  4. Tekan transkripsi dan biarkan Whisper memproses rekaman sepenuhnya di tab browser Anda.
  5. Salin teksnya langsung atau unduh file .txt/.srt setelah siap.

Kasus penggunaan umum

  • Mendapatkan draf tulisan kasar dari memo suara yang direkam di ponsel Anda sebelum merapikannya secara manual.
  • Mengubah wawancara singkat yang direkam menjadi teks yang dapat dicari tanpa mengunggahnya ke layanan transkripsi cloud.
  • Membuat file subtitle .srt awal untuk klip pendek, yang akan dikoreksi setelahnya.
  • Merekam catatan suara cepat dengan Voice Recorder situs ini, lalu mentranskripsikannya di tab browser yang sama.
  • Mendapatkan transkrip awal dari rekaman kuliah atau rapat ketika akurasi sempurna tidak diperlukan.

Pertanyaan yang sering diajukan

Seberapa akurat transkripsinya?

Sangat bergantung pada kualitas audio. Rekaman bahasa Inggris yang jernih, satu pembicara, direkam dekat mikrofon dengan sedikit suara latar akan ditranskripsikan dengan cukup baik. Aksen, pembicaraan yang tumpang tindih, musik atau suara latar, dan kosakata khusus (nama, jargon, singkatan) semuanya meningkatkan kesalahan. Ini model kecil dan terkuantisasi yang dipilih agar bisa berjalan di dalam tab browser, bukan model Whisper terbesar, jadi perlakukan hasilnya sebagai draf berguna yang perlu ditinjau dan dikoreksi, bukan transkrip final.

Apakah ini bekerja dengan bahasa selain bahasa Inggris?

Tidak. Alat ini menggunakan whisper-tiny.en, varian Whisper khusus bahasa Inggris, dipilih karena lebih kecil dan lebih akurat untuk bahasa Inggris dibandingkan model tiny multibahasa. Audio dalam bahasa lain akan menghasilkan hasil yang buruk atau tidak masuk akal. Dukungan untuk bahasa lain saat ini belum tersedia.

Mengapa perlu mengunduh sesuatu sebelum alat ini bisa berfungsi?

Model pengenalan ucapan dan mesin WebAssembly yang menjalankannya (total sekitar 68 MB) tidak dibangun langsung ke dalam halaman; keduanya diambil sekali dari situs ini dan disimpan di cache oleh browser Anda, mirip dengan cara alat OCR mengunduh model bahasa. Setelah unduhan pertama itu, transkripsi berjalan sepenuhnya offline. Tidak ada yang diambil dari CDN pihak ketiga mana pun.

Apakah audio saya diunggah ke suatu tempat?

Tidak. Rekaman didekode dan diproses sepenuhnya di dalam tab browser Anda menggunakan Web Audio API dan model Whisper lokal. Tidak ada file audio, dan tidak ada teks hasil transkripsi, yang pernah dikirim ke server. Anda bisa memutuskan koneksi jaringan setelah model selesai diunduh dan transkripsi tetap berfungsi.

Berapa lama waktu yang dibutuhkan transkripsi?

Bergantung pada CPU perangkat Anda dan panjang rekaman, karena semuanya berjalan secara lokal, bukan di perangkat keras server. Klip pendek (di bawah satu menit) biasanya selesai dalam hitungan detik hingga kurang dari satu menit. Rekaman panjang, seperti wawancara satu jam, membutuhkan waktu yang sebanding lebih lama dan akan membuat tab browser Anda sibuk selama itu; biarkan tab tetap terbuka dan jangan berpindah halaman selagi prosesnya berjalan.

Apa bedanya keluaran .txt dan .srt?

File .txt adalah teks hasil transkripsi biasa tanpa stempel waktu, berguna untuk dibaca atau ditempel di tempat lain. File .srt adalah format subtitle standar dengan rentang stempel waktu untuk setiap segmen yang diucapkan, berguna untuk menambahkan teks berjalan ke video. Keduanya dihasilkan dari transkripsi yang sama; pilih mana yang sesuai dengan kebutuhan Anda selanjutnya.