Artikel
Memperlambat audio untuk transkripsi
Pembicara yang cepat, aksen yang tidak familiar, dan beberapa suara yang tumpang tindih adalah tiga alasan utama transkripsi terhenti. Memperlambat rekaman memberi waktu untuk menangkap apa yang dikatakan. Masalahnya adalah bahwa perlambatan pemutaran yang naif juga menurunkan nada setiap suara, yang membuat ucapan lebih sulit diikuti daripada lebih mudah. Artikel ini menjelaskan perbedaan antara pengurangan kecepatan sederhana dan time-stretching yang mempertahankan nada, serta membahas rentang praktis yang benar-benar membantu.
Mengapa memperlambat itu membantu
Ucapan manusia membawa banyak informasi dalam jendela waktu yang singkat. Pembicara yang cepat dapat menyampaikan 200 kata per menit atau lebih, dan pada kecepatan itu, telinga memiliki sedikit waktu untuk menyelesaikan fonem individual sebelum suku kata berikutnya tiba. Memperlambat audio memberi otak lebih banyak waktu pemrosesan per suku kata, yang paling penting dalam tiga situasi: pembicara dengan aksen yang tidak familiar yang pemetaan fonemnya berbeda dari yang Anda harapkan; bagian teknis yang padat di mana setiap kata membawa makna dan satu kesalahan dengar menghasilkan istilah yang salah; dan rekaman dengan dua atau lebih suara yang tumpang tindih di mana telinga harus melacak aliran terpisah sekaligus. Dalam ketiga kasus, tujuannya bukan mendengar sesuatu yang tidak ada, tetapi memberi diri Anda cukup waktu untuk mendengar dengan akurat apa yang sudah direkam. Kecepatan pemutaran 0.75x sering cukup untuk aksen atau bagian yang padat. Kecepatan 0.5x berguna untuk bagian pendek di mana beberapa kali pass pertama belum dapat menyelesaikan kata-kata.

Kecepatan dan nada: mengapa perlambatan naif tidak berhasil
Cara paling sederhana untuk memperlambat audio adalah memutar sampel pada kecepatan yang lebih rendah dari saat direkam. Begitulah cara perekam kaset lama memperlambat: putar kaset lebih lambat dan durasi serta nada keduanya turun bersama. Pada 0.75x, suara turun sekitar sepertiga minor. Pada 0.5x, turun satu oktaf penuh. Hasilnya adalah distorsi lambat dan dalam yang familiar yang membuat ucapan terdengar tidak alami dan, paradoksnya, lebih sulit dipahami karena frekuensi formant yang membedakan vokal semuanya telah bergeser ke bawah. Pendekatan yang benar adalah time-stretching: mengubah durasi audio tanpa mengubah frekuensi. Nada setiap suara tetap sama; hanya kecepatan datangnya suku kata yang berubah. Inilah pendekatan yang digunakan oleh tool audio-speed dan oleh sebagian besar perangkat lunak transkripsi khusus. Hasil perseptualnya adalah bahwa rekaman yang diperlambat terdengar seperti pembicara yang sama berbicara dengan kecepatan lebih lambat, yang persis seperti yang Anda butuhkan ketika tujuannya adalah transkripsi yang akurat.
Cara time-stretching bekerja: pendekatan atempo
Algoritma yang paling banyak digunakan untuk time-stretching dalam tool audio praktis didasarkan pada phase vocoding, dan implementasi umumnya dalam ffmpeg adalah filter atempo. Audio input dibagi menjadi bingkai pendek yang tumpang tindih, biasanya 20 hingga 40 milidetik masing-masing. Algoritma menganalisis hubungan fase antara bingkai yang berdekatan, kemudian mensintesis bingkai baru pada kecepatan yang dimodifikasi sambil menyesuaikan fase sehingga bingkai yang berurutan sejajar dengan benar. Hasilnya adalah sinyal output berkelanjutan yang durasinya telah berubah tetapi konten frekuensinya tidak. Karena bingkai-bingkai pendek relatif terhadap periode nada khas suara manusia, frekuensi fundamental ucapan dipertahankan selama perentangan. Satu efek samping dari algoritma ini adalah bahwa transien yang cepat, seperti bunyi klik konsonan, dapat sedikit kabur ketika perentangan besar, karena sintesis frame-overlap memperkenalkan sedikit rata-rata. Ini bukan cacat dalam implementasi; ini adalah sifat inheren dari keluarga algoritma overlap-add.

Rentang kecepatan praktis dan batas kualitas
Untuk pekerjaan transkripsi, dua nilai kecepatan mencakup sebagian besar kebutuhan praktis. Pada 0.75x, ucapan direntangkan menjadi 133% dari durasi aslinya. Kluster konsonan dan transisi vokal yang cepat menjadi lebih mudah dipisahkan, dan perubahannya cukup kecil sehingga algoritma memperkenalkan sangat sedikit artefak yang dapat dirasakan. Sebagian besar pendengar dapat mengikuti ucapan pada kecepatan ini tanpa kehilangan ritme alami kalimat. Pada 0.5x, audio direntangkan menjadi dua kali panjang aslinya. Ini berguna untuk satu kalimat atau bagian pendek yang sulit, tetapi terlalu lambat untuk mendengarkan berkelanjutan selama beberapa menit; konsentrasi turun sebelum kata-kata terselesaikan. Di bawah 0.5x, kualitas output menurun secara nyata. Sintesis overlap-add mulai memperkenalkan gemetar atau phasiness pada vokal yang diperpanjang, dan isyarat waktu antara konsonan dan vokal yang membawa prosodi menjadi terdistorsi. Filter atempo dalam ffmpeg memberlakukan minimum 0.5x untuk satu pass, yang mencerminkan batas kualitas ini. Nilai di bawah 0.5x memerlukan rantai dua pass, dan tingkat artefak meningkat sesuai. Untuk hampir semua kasus penggunaan transkripsi, tetap pada 0.75x atau paling banyak 0.5x untuk segmen pendek menghasilkan output yang bersih dan dapat digunakan.
Melakukannya secara lokal dengan tool audio-speed
Tool audio-speed di situs ini berjalan sepenuhnya di browser menggunakan ffmpeg yang dikompilasi ke WebAssembly. Anda menjatuhkan file audio ke halaman, mengatur pengali kecepatan, dan pemrosesan terjadi di perangkat Anda. Rekaman tidak meninggalkan mesin Anda kapan pun: tidak ada unggah, tidak ada server, tidak ada layanan pihak ketiga. Ini penting untuk percakapan yang direkam, wawancara, dikte medis, prosedur hukum, dan konteks lain di mana konten audio sensitif. Tool menerima format audio umum yang ditangani oleh ffmpeg, termasuk MP3, WAV, M4A, OGG, dan FLAC. Output adalah file yang dapat diunduh pada kecepatan yang Anda pilih. Karena pemrosesan berjalan secara lokal, waktu yang dibutuhkan tergantung pada panjang file dan kecepatan perangkat Anda. Beberapa menit audio biasanya diproses dalam waktu jauh di bawah satu menit pada laptop modern. Tool menggunakan filter atempo yang sama yang dijelaskan dalam artikel ini, sehingga karakteristik kualitas yang dijelaskan di atas berlaku langsung untuk apa yang akan Anda dengar dalam output.
Alat dalam artikel ini
Pertanyaan yang sering diajukan
Apakah memperlambat audio juga mengubah nada?
Tergantung pada metodenya. Pengurangan kecepatan pemutaran sederhana memang mengubah nada: pada 0.5x, suara turun satu oktaf penuh. Tool audio-speed menggunakan time-stretching (filter atempo) yang mengubah durasi tanpa mengubah nada, sehingga suara tetap pada frekuensi aslinya.
Apa kecepatan paling lambat yang masih terdengar bersih?
Pada 0.75x outputnya bersih untuk sebagian besar rekaman. Pada 0.5x dapat diterima untuk bagian pendek. Di bawah 0.5x, algoritma overlap-add mulai memperkenalkan artefak yang terdengar pada vokal yang diperpanjang dan transisi konsonan. Untuk pekerjaan transkripsi, tetap pada atau di atas 0.5x memberikan hasil terbaik.
Apakah file diunggah saat menggunakan tool audio-speed?
Tidak. Tool audio-speed berjalan sepenuhnya di browser. File diproses secara lokal di perangkat Anda menggunakan WebAssembly. Tidak ada yang dikirim ke server mana pun, sehingga konten rekaman Anda tetap privat.