Ingen upload, 100% lokalt, ingen konto

Artikel

Nedsænkning af lyd til transskription

Hurtige talere, uvante accenter og flere overlappende stemmer er de tre vigtigste grunde til, at en transskription går i stå. At sænke optagelsen ned giver tid til at fange, hvad der blev sagt. Fangsten er, at naiv afspilningssænkning også sænker tonen for hver stemme, hvilket gør tale sværere at følge frem for lettere. Denne artikel forklarer forskellen mellem simpel hastighedsreduktion og pitchbevarende tidsstrækking og dækker de praktiske intervaller, der faktisk hjælper.

Hvorfor nedsænkning hjælper

Menneskelig tale bærer meget information i et kort vindue. En hurtig taler kan levere 200 ord pr. minut eller mere, og ved den hastighed har øret lidt tid til at opløse individuelle fonemer, inden den næste stavelse ankommer. Nedsænkning af lyden giver hjernen mere behandlingstid pr. stavelse, hvilket er vigtigst i tre situationer: en taler med en uvant accent, hvis fonem-kortlægning adskiller sig fra det forventede; et tæt teknisk afsnit, hvor hvert ord bærer betydning, og et enkelt fejlhør producerer et forkert udtryk; og optagelser med to eller flere overlappende stemmer, hvor øret skal spore separate streams på én gang. I alle tre tilfælde er målet ikke at høre noget, der ikke var der, men at give sig selv nok tid til at høre nøjagtigt, hvad der allerede var optaget. En 0,75x afspilningshastighed er ofte nok til en accent eller et tæt afsnit. En 0,5x hastighed er nyttig til et kort afsnit, hvor de første par passager ikke har opløst ordene.

En bølgeformvisning, der viser et tale-segment, med en tidsakse strakt horisontalt for at repræsentere langsommere afspilning, stavelsesgrænser synlige som toppe og dale

Hastighed og tonehøjde: hvorfor naiv nedsænkning ikke virker

Den simpleste måde at sænke lyd er at afspille prøverne ved en lavere hastighed end de blev optaget. Sådan fungerede gamle båndoptagere, der sænkede: spin båndet langsommere, og både varighed og tonehøjde falder sammen. Ved 0,75x falder stemmerne med ca. en lille terts. Ved 0,5x falder de en hel oktav. Resultatet er den velkendte langsomme, dybe forvrængning, der får tale til at lyde unaturlig og paradoksalt sværere at forstå, fordi de formantfrekvenser, der skelner vokaler, alle er skiftet ned. Den korrekte tilgang er tidsstrækking: ændring af varigheden af lyden uden at ændre frekvenserne. Tonehøjden på enhver stemme forbliver den samme; kun den hastighed, med hvilken stavelser ankommer, ændrer sig. Dette er den tilgang, der bruges af audio-speed-værktøjet og af de fleste dedikerede transskriptionssoftware. Det perceptuelle resultat er, at en nedsænket optagelse lyder som den samme taler, der taler langsommere, hvilket er præcis, hvad du har brug for, når målet er præcis transskription.

Hvordan tidsstrækking virker: atempo-tilgangen

Den mest udbredte algoritme til tidsstrækking i praktiske lydværktøjer er baseret på fase-vocodering, og dens almindelige implementering i ffmpeg er atempo-filteret. Inputlyden opdeles i korte overlappende rammer, typisk 20 til 40 millisekunder hver. Algoritmen analyserer faserelationerne mellem tilstødende rammer og syntetiserer derefter nye rammer med en modificeret hastighed, mens faserne justeres, så successive rammer sættes korrekt sammen. Resultatet er et kontinuerligt outputsignal, hvis varighed er ændret, men hvis frekvensindhold ikke er det. Fordi rammerne er korte i forhold til den typiske tonehøjdeperiode for en menneskestemme, bevares den fundamentale frekvens af tale på tværs af strækningen. En sideeffekt af algoritmen er, at hurtige transienter, såsom klikket fra en konsonant, kan være let slørede, når strækningen er stor, fordi ramme-overlap-syntesen introducerer en lille mængde midling. Dette er ikke en fejl i implementeringen; det er en iboende egenskab ved overlap-add-familien af algoritmer.

Et diagram over overlap-add-tidsstrækningsprocessen: inputlyd-rammer til venstre, overlappende syntese-rammer i midten og den strakte outputbølgeform til højre

Praktiske hastighedsintervaller og kvalitetsgrænser

Til transskriptionsarbejde dækker to hastighedsværdier de fleste praktiske behov. Ved 0,75x strækkes tale til 133% af sin originale varighed. Konsonantklynger og hurtige vokaltransitioner bliver lettere at adskille, og ændringen er lille nok til, at algoritmen introducerer meget lidt mærkbart artefakt. De fleste lyttere kan følge tale ved denne hastighed uden at miste den naturlige rytme i sætningen. Ved 0,5x strækkes lyden til dobbelt sin originale længde. Dette er nyttigt til en enkelt sætning eller et kort vanskeligt afsnit, men det er for langsomt til kontinuerlig lytning over flere minutter; koncentrationen falder, inden ordene er opløst. Under 0,5x forringes outputkvaliteten mærkbart. Overlap-add-syntesen begynder at introducere en flimren eller faseagtighed på vedvarende vokaler, og timingssignalerne mellem konsonanter og vokaler, der bærer prosodi, forvrænges. Atempo-filteret i ffmpeg pålægger et minimum på 0,5x for et enkelt pass, hvilket afspejler denne kvalitetsgrænse. Værdier under 0,5x kræver kæde af to passes, og artefaktniveauet stiger tilsvarende. For næsten alle transskriptionsanvendelsestilfælde producerer fastholdelse ved 0,75x eller højst 0,5x for korte segmenter rent, brugbart output.

Gør det lokalt med audio-speed-værktøjet

Audio-speed-værktøjet på dette websted kører helt i browseren ved hjælp af ffmpeg kompileret til WebAssembly. Du dropper din lydfil på siden, indstiller hastighedsmultiplikatoren, og behandlingen sker på din enhed. Optagelsen forlader ikke din maskine på noget tidspunkt: ingen upload, ingen server, ingen tredjeparts tjeneste. Det betyder noget for optagede samtaler, interviews, medicinsk diktat, retssager og enhver anden kontekst, hvor lydindholdet er følsomt. Værktøjet accepterer de almindelige lydformater håndteret af ffmpeg, herunder MP3, WAV, M4A, OGG og FLAC. Outputtet er en downloadbar fil ved den hastighed, du valgte. Fordi behandlingen kører lokalt, afhænger den tid, det tager, af filens længde og din enheds hastighed. Et par minutters lyd behandles typisk i godt under et minut på en moderne laptop. Værktøjet bruger det samme atempo-filter beskrevet i denne artikel, så kvalitetskarakteristikkerne beskrevet ovenfor gælder direkte for det, du vil høre i outputtet.

Værktøjer i denne artikel

Ofte stillede spørgsmål

Vil nedsænkning af lyd også ændre tonehøjden?

Det afhænger af metoden. Simpel afspilningshastighed-reduktion ændrer tonehøjden: ved 0,5x falder stemmerne med en hel oktav. Audio-speed-værktøjet bruger tidsstrækking (atempo-filteret), som ændrer varighed uden at ændre tonehøjden, så stemmerne forbliver ved deres originale frekvens.

Hvad er den langsomste hastighed, der stadig lyder rent?

Ved 0,75x er outputtet rent for de fleste optagelser. Ved 0,5x er det acceptabelt til korte passager. Under 0,5x begynder overlap-add-algoritmen at introducere hørbare artefakter på vedvarende vokaler og konsonanttransitioner. Til transskriptionsarbejde giver fastholdelse ved eller over 0,5x de bedste resultater.

Uploades filen, når jeg bruger audio-speed-værktøjet?

Nej. Audio-speed-værktøjet kører helt i browseren. Filen behandles lokalt på din enhed ved hjælp af WebAssembly. Intet sendes til nogen server, så indholdet af din optagelse forbliver privat.