Articol
Încetinirea audio pentru transcriere
Vorbitorii rapizi, accentele nefamiliare și vocile multiple suprapuse sunt cele trei motive principale pentru care o transcriere se oprește. Încetinirea înregistrării câștigă timp pentru a prinde ce s-a spus. Problema este că simpla reducere a vitezei de redare coboară și tonalitatea fiecărei voci, ceea ce face vorbirea mai greu de urmărit, nu mai ușor. Acest articol explică diferența dintre simpla reducere a vitezei și time-stretching-ul cu păstrarea înălțimii tonale și acoperă intervalele practice care ajută cu adevărat.
De ce ajută încetinirea
Vorbirea umană transportă o mulțime de informații într-o fereastră scurtă. Un vorbitor rapid poate livra 200 de cuvinte pe minut sau mai mult, iar la acea rată, urechea are puțin timp să rezolve fonemele individuale înainte să sosească silaba următoare. Încetinirea audio oferă creierului mai mult timp de procesare per silabă, ceea ce contează cel mai mult în trei situații: un vorbitor cu un accent nefamiliar al cărui mapping de foneme diferă de ce așteptați; un pasaj tehnic dens în care fiecare cuvânt transportă sens și o singură greșeală de auz produce un termen greșit; și înregistrări cu două sau mai multe voci suprapuse în care urechea trebuie să urmărească fluxuri separate simultan. În toate cele trei cazuri, scopul nu este să auziți ceva ce nu a fost acolo, ci să vă dați suficient timp să auziți cu acuratețe ce a fost deja înregistrat. O rată de redare de 0.75x este adesea suficientă pentru un accent sau un pasaj dens. O rată de 0.5x este utilă pentru o scurtă secțiune în care primele treceri nu au rezolvat cuvintele.

Viteză și tonalitate: de ce reducerea naivă a vitezei nu funcționează
Cel mai simplu mod de a încetini audio este să redați eșantioanele la o rată mai mică decât au fost înregistrate. Acesta este modul în care caseta lentă a încetinitelor: rotiți banda mai lent și atât durata, cât și tonalitatea scad împreună. La 0.75x, vocile coboară cu aproximativ o terță minoră. La 0.5x, coboară o octavă completă. Rezultatul este distorsiunea lentă, joasă, familiară, care face vorbirea să sune nenatural și, paradoxal, mai greu de înțeles deoarece frecvențele formant care disting vocalele s-au deplasat cu toatele în jos. Abordarea corectă este time-stretching-ul: schimbarea duratei audio fără a schimba frecvențele. Tonalitatea fiecărei voci rămâne aceeași; se schimbă doar rata la care sosesc silabele. Aceasta este abordarea folosită de instrumentul audio-speed și de majoritatea software-urilor dedicate de transcriere. Rezultatul perceptual este că o înregistrare încetinită sună ca același vorbitor care vorbește mai rar, ceea ce este exact ce aveți nevoie când scopul este transcrierea precisă.
Cum funcționează time-stretching-ul: abordarea atempo
Cel mai utilizat algoritm pentru time-stretching în instrumentele practice de audio se bazează pe vocoder de fază, iar implementarea sa comună în ffmpeg este filtrul atempo. Audio-ul de intrare este împărțit în cadre scurte suprapuse, de obicei 20 până la 40 de milisecunde fiecare. Algoritmul analizează relațiile de fază dintre cadrele adiacente, apoi sintetizează cadre noi la o rată modificată ajustând fazele astfel încât cadrele succesive să se alinieze corect. Rezultatul este un semnal de ieșire continuu a cărui durată s-a schimbat, dar al cărui conținut de frecvență nu s-a schimbat. Deoarece cadrele sunt scurte față de perioada tipică de pitch a unei voci umane, frecvența fundamentală a vorbirii este păstrată pe toată extinderea. Un efect secundar al algoritmului este că tranzienții rapizi, cum ar fi clicul unui consoant, pot fi ușor estompați când extensia este mare, deoarece sinteza cu suprapunere de cadre introduce o mică cantitate de mediere. Acesta nu este un defect al implementării; este o proprietate inerentă a familiei de algoritmi overlap-add.

Intervale practice de viteză și limite de calitate
Pentru munca de transcriere, două valori de viteză acoperă majoritatea nevoilor practice. La 0.75x, vorbirea este extinsă la 133% din durata sa originală. Grupurile de consoane și tranzițiile rapide ale vocalelor devin mai ușor de separat, iar schimbarea este suficient de mică astfel încât algoritmul introduce foarte puțin artefact perceptibil. Majoritatea ascultătorilor pot urmări vorbirea la această rată fără a pierde ritmul natural al propoziției. La 0.5x, audio-ul este extins la de două ori lungimea sa originală. Aceasta este utilă pentru o singură propoziție sau un scurt pasaj dificil, dar este prea lentă pentru ascultare continuă pe mai multe minute; concentrarea scade înainte ca cuvintele să fie rezolvate. Sub 0.5x, calitatea rezultatelor se degradează notabil. Sinteza overlap-add începe să introducă un flutter sau o defazare pe vocalele susținute, iar indiciile de timp dintre consoane și vocale care transportă prozodia devin distorsionate. Filtrul atempo din ffmpeg impune un minim de 0.5x pentru o singură trecere, ceea ce reflectă această limită de calitate. Valorile sub 0.5x necesită înlănțuirea a două treceri, iar nivelul de artefact crește corespunzător. Pentru aproape toate cazurile de utilizare a transcrierii, menținerea la 0.75x sau cel mult 0.5x pentru segmente scurte produce o ieșire curată și utilizabilă.
Realizarea locală cu instrumentul audio-speed
Instrumentul audio-speed de pe acest site rulează complet în browser folosind ffmpeg compilat în WebAssembly. Puneți fișierul audio pe pagină, setați multiplicatorul de viteză și procesarea are loc pe dispozitivul dvs. Înregistrarea nu vă părăsește mașina în niciun moment: nicio încărcare, niciun server, niciun serviciu terț. Aceasta contează pentru conversații înregistrate, interviuri, dictare medicală, proceduri legale și orice alt context în care conținutul audio este sensibil. Instrumentul acceptă formatele audio comune gestionate de ffmpeg, inclusiv MP3, WAV, M4A, OGG și FLAC. Rezultatul este un fișier descărcabil la viteza aleasă. Deoarece procesarea rulează local, timpul necesar depinde de lungimea fișierului și de viteza dispozitivului dvs. Câteva minute de audio se procesează de obicei în mai puțin de un minut pe un laptop modern. Instrumentul folosește același filtru atempo descris în acest articol, astfel că caracteristicile de calitate descrise mai sus se aplică direct la ce veți auzi în ieșire.
Instrumente din acest articol
Întrebări frecvente
Va schimba tonalitatea și încetinirea audio?
Depinde de metodă. Simpla reducere a ratei de redare schimbă tonalitatea: la 0.5x, vocile coboară cu o octavă completă. Instrumentul audio-speed folosește time-stretching (filtrul atempo) care schimbă durata fără a schimba tonalitatea, astfel că vocile rămân la frecvența lor originală.
Care este cea mai lentă viteză care sună în continuare clar?
La 0.75x ieșirea este curată pentru majoritatea înregistrărilor. La 0.5x este acceptabilă pentru pasaje scurte. Sub 0.5x, algoritmul overlap-add începe să introducă artefacte audibile pe vocalele susținute și tranzițiile de consoane. Pentru munca de transcriere, menținerea la sau peste 0.5x oferă cele mai bune rezultate.
Este fișierul încărcat când folosesc instrumentul audio-speed?
Nu. Instrumentul audio-speed rulează complet în browser. Fișierul este procesat local pe dispozitivul dvs. folosind WebAssembly. Nimic nu este trimis vreunui server, astfel că conținutul înregistrării dvs. rămâne privat.