Tiada muat naik, 100% setempat, tiada akaun

Artikel

Memperlahankan audio untuk transkripsi

Penutur cepat, loghat yang tidak biasa, dan berbilang suara yang bertindih ialah tiga sebab utama transkripsi terhenti. Memperlahankan rakaman memberi masa untuk menangkap apa yang dikatakan. Masalahnya ialah perlahan main balik yang naif juga menurunkan pic setiap suara, yang menjadikan pertuturan lebih sukar diikuti bukannya lebih mudah. Artikel ini menerangkan perbezaan antara pengurangan kelajuan mudah dan peregangan masa yang memelihara pic, dan merangkumi julat praktikal yang benar-benar membantu.

Mengapa memperlahankan membantu

Pertuturan manusia membawa banyak maklumat dalam tetingkap pendek. Penutur cepat boleh menyampaikan 200 perkataan seminit atau lebih, dan pada kadar itu, telinga mempunyai sedikit masa untuk menyelesaikan fonem individu sebelum suku kata seterusnya tiba. Memperlahankan audio memberikan otak lebih masa pemprosesan setiap suku kata, yang paling penting dalam tiga situasi: penutur dengan loghat yang tidak biasa yang pemetaan fonem berbeza daripada yang anda jangkakan; petikan teknikal yang padat di mana setiap perkataan membawa makna dan satu salah dengar menghasilkan istilah yang salah; dan rakaman dengan dua atau lebih suara yang bertindih di mana telinga perlu mengikuti aliran berasingan serentak. Dalam ketiga-tiga kes, matlamatnya bukan untuk mendengar sesuatu yang tidak ada di sana, tetapi untuk memberi diri anda cukup masa untuk mendengar dengan tepat apa yang telah dirakam. Kadar main balik 0.75x sering mencukupi untuk loghat atau petikan yang padat. Kadar 0.5x berguna untuk bahagian pendek di mana beberapa laluan pertama tidak menyelesaikan perkataan.

Paparan bentuk gelombang menunjukkan segmen pertuturan, dengan paksi masa diregangkan secara mendatar untuk mewakili main balik lebih perlahan, sempadan suku kata kelihatan sebagai puncak dan lembah

Kelajuan dan pic: mengapa perlambatan naif tidak berfungsi

Cara paling mudah untuk memperlahankan audio ialah memainkan semula sampel pada kadar yang lebih rendah daripada yang dirakam. Beginilah cara perakam pita lama memperlahankan: putar pita lebih perlahan dan kedua-dua durasi dan pic jatuh bersama. Pada 0.75x, suara jatuh kira-kira satu minor ketiga. Pada 0.5x, ia jatuh satu oktaf penuh. Hasilnya ialah herotan perlahan dan dalam yang biasa yang menjadikan pertuturan terdengar tidak semula jadi dan, secara paradoks, lebih sukar difahami kerana frekuensi format yang membezakan vokal semuanya telah beralih ke bawah. Pendekatan yang betul ialah peregangan masa: menukar durasi audio tanpa mengubah frekuensi. Pic setiap suara kekal sama; hanya kadar ketibaan suku kata yang berubah. Inilah pendekatan yang digunakan oleh alat audio-speed dan oleh kebanyakan perisian transkripsi khusus. Hasil persepsi ialah rakaman yang diperlambat terdengar seperti penutur yang sama bercakap pada kadar yang lebih perlahan, yang itulah yang anda perlukan apabila matlamatnya ialah transkripsi yang tepat.

Cara peregangan masa berfungsi: pendekatan atempo

Algoritma yang paling banyak digunakan untuk peregangan masa dalam alat audio praktikal adalah berdasarkan pengekodan fasa, dan pelaksanaan biasanya dalam ffmpeg ialah penapis atempo. Audio input dibahagikan kepada bingkai pendek yang bertindih, biasanya 20 hingga 40 milisaat setiap satu. Algoritma menganalisis hubungan fasa antara bingkai bersebelahan, kemudian mensintesis bingkai baharu pada kadar yang diubah suai sambil melaraskan fasa supaya bingkai berturutan sejajar dengan betul. Hasilnya ialah isyarat output berterusan yang durasinya telah berubah tetapi kandungan frekuensinya tidak. Kerana bingkai pendek berbanding tempoh pic tipikal suara manusia, frekuensi asas pertuturan dipelihara merentasi peregangan. Satu kesan sampingan algoritma ialah transien yang cepat, seperti klik konsonan, boleh sedikit kabus apabila peregangan besar, kerana sintesis pertindihan bingkai memperkenalkan sedikit purata. Ini bukan kecacatan dalam pelaksanaan; ia ialah sifat semula jadi keluarga algoritma pertindihan-tambah.

Gambar rajah proses peregangan masa pertindihan-tambah: bingkai audio input di sebelah kiri, bingkai sintesis bertindih di tengah, dan bentuk gelombang output yang diregangkan di sebelah kanan

Julat kelajuan praktikal dan had kualiti

Untuk kerja transkripsi, dua nilai kelajuan merangkumi kebanyakan keperluan praktikal. Pada 0.75x, pertuturan diregangkan kepada 133% durasi asalnya. Kelompok konsonan dan peralihan vokal cepat menjadi lebih mudah dipisahkan, dan perubahan itu cukup kecil supaya algoritma memperkenalkan sangat sedikit artifak yang dapat dilihat. Kebanyakan pendengar boleh mengikuti pertuturan pada kadar ini tanpa kehilangan irama semula jadi ayat. Pada 0.5x, audio diregangkan kepada dua kali panjang asalnya. Ini berguna untuk satu ayat atau petikan sukar yang pendek, tetapi terlalu perlahan untuk mendengar secara berterusan selama beberapa minit; tumpuan jatuh sebelum perkataan diselesaikan. Di bawah 0.5x, kualiti output merosot dengan ketara. Sintesis pertindihan-tambah mula memperkenalkan turun naik atau kesan fasa pada vokal yang ditahan, dan isyarat masa antara konsonan dan vokal yang membawa prosodi menjadi herot. Penapis atempo dalam ffmpeg mengenakan minimum 0.5x untuk satu laluan tunggal, yang mencerminkan had kualiti ini. Nilai di bawah 0.5x memerlukan rantaian dua laluan, dan tahap artifak meningkat dengan sewajarnya. Untuk hampir semua kes penggunaan transkripsi, kekal pada 0.75x atau paling banyak 0.5x untuk segmen pendek menghasilkan output yang bersih dan boleh digunakan.

Lakukan secara tempatan dengan alat audio-speed

Alat audio-speed di laman ini berjalan sepenuhnya dalam pelayar menggunakan ffmpeg yang dikompilasi kepada WebAssembly. Anda menjatuhkan fail audio anda ke halaman, menetapkan pengganda kelajuan, dan pemprosesan berlaku pada peranti anda. Rakaman tidak meninggalkan mesin anda pada bila-bila masa: tiada muat naik, tiada pelayan, tiada perkhidmatan pihak ketiga. Ini penting untuk perbualan yang dirakam, temu bual, diktasi perubatan, prosiding undang-undang, dan sebarang konteks lain di mana kandungan audio adalah sensitif. Alat ini menerima format audio biasa yang dikendalikan oleh ffmpeg, termasuk MP3, WAV, M4A, OGG, dan FLAC. Output ialah fail yang boleh dimuat turun pada kelajuan yang anda pilih. Kerana pemprosesan berjalan secara tempatan, masa yang diambil bergantung pada panjang fail dan kelajuan peranti anda. Beberapa minit audio biasanya diproses dalam kurang dari seminit pada komputer riba moden. Alat ini menggunakan penapis atempo yang sama yang diterangkan dalam artikel ini, jadi ciri kualiti yang diterangkan di atas terpakai terus kepada apa yang anda akan dengar dalam output.

Alat dalam artikel ini

Soalan lazim

Adakah memperlahankan audio juga mengubah pic?

Bergantung pada kaedah. Pengurangan kadar main balik mudah memang mengubah pic: pada 0.5x, suara jatuh satu oktaf penuh. Alat audio-speed menggunakan peregangan masa (penapis atempo) yang mengubah durasi tanpa mengubah pic, jadi suara kekal pada frekuensi asalnya.

Apakah kelajuan paling perlahan yang masih terdengar bersih?

Pada 0.75x output bersih untuk kebanyakan rakaman. Pada 0.5x ia boleh diterima untuk petikan pendek. Di bawah 0.5x, algoritma pertindihan-tambah mula memperkenalkan artifak yang boleh didengar pada vokal yang ditahan dan peralihan konsonan. Untuk kerja transkripsi, kekal pada atau melebihi 0.5x memberikan hasil terbaik.

Adakah fail dimuat naik apabila saya menggunakan alat audio-speed?

Tidak. Alat audio-speed berjalan sepenuhnya dalam pelayar. Fail diproses secara tempatan pada peranti anda menggunakan WebAssembly. Tiada yang dihantar ke mana-mana pelayan, jadi kandungan rakaman anda kekal persendirian.