Ingen uppladdning, 100% lokalt, inget konto

Artikel

Sänka hastigheten på ljud för transkribering

Snabba talare, obekanta accenter och flera överlappande röster är de tre huvudorsakerna till att en transkribering stannar. Att sänka hastigheten på inspelningen ger tid att uppfatta vad som sades. Fångsten är att naiv uppspelningsfördröjning också sänker tonen på varje röst, vilket gör tal svårare att följa snarare än lättare. Den här artikeln förklarar skillnaden mellan enkel hastighetsminskning och tonbevarande tidsträckning, och täcker de praktiska intervall som faktiskt hjälper.

Varför det hjälper att sakta ner

Mänskligt tal bär mycket information i ett kort fönster. En snabb talare kan leverera 200 ord per minut eller mer, och i den takten har örat lite tid att lösa upp enskilda fonem innan nästa stavelse anländer. Att sänka ljudet ger hjärnan mer bearbetningstid per stavelse, vilket spelar störst roll i tre situationer: en talare med en obekant accent vars fonemkartläggning skiljer sig från vad du förväntar dig; ett tätt tekniskt avsnitt där varje ord bär mening och ett enda feltolkat ord producerar en felaktig term; och inspelningar med två eller fler överlappande röster där örat måste spåra separata strömmar på en gång. I alla tre fallen är målet inte att höra något som inte var där, utan att ge sig själv tillräckligt med tid för att höra korrekt vad som redan spelades in. En uppspelningshastighet på 0.75x är ofta tillräcklig för en accent eller ett tätt avsnitt. En hastighet på 0.5x är användbar för ett kort avsnitt där de första passen inte har löst orden.

En vågformsvisning som visar ett talsegment, med en tidsaxel sträckt horisontellt för att representera långsammare uppspelning, stavelsegränser synliga som toppar och dalar

Hastighet och ton: varför naiv fördröjning inte fungerar

Det enklaste sättet att sänka ljud är att spela tillbaka samplarna i en lägre takt än de spelades in. Så saktade gamla bandspelare ner: spinn bandet långsammare och båda varaktigheten och tonen sjunker tillsammans. Vid 0.75x sjunker röster med ungefär en liten ters. Vid 0.5x sjunker de en hel oktav. Resultatet är den välbekanta långsamma, djupa förvrängningen som gör tal onaturrligt och paradoxalt svårare att förstå eftersom formantsfrekvenserna som skiljer vokaler har alla skiftat ner. Det korrekta tillvägagångssättet är tidsträckning: att ändra varaktigheten på ljudet utan att ändra frekvenserna. Tonen på varje röst förblir densamma; bara den takt med vilken stavelser anländer ändras. Detta är tillvägagångssättet som används av audio-speed-verktyget och av de flesta dedikerade transkriberingsprogram. Det perceptuella resultatet är att en inbromsad inspelning låter som samma talare som pratar i ett långsammare tempo, vilket är exakt vad du behöver när målet är korrekt transkribering.

Hur tidsträckning fungerar: atempo-tillvägagångssättet

Den mest använda algoritmen för tidsträckning i praktiska ljudverktyg är baserad på fasvokodning, och dess vanliga implementering i ffmpeg är atempo-filtret. Ingångsljudet delas i korta överlappande ramar, typiskt 20 till 40 millisekunder vardera. Algoritmen analyserar fasrelationerna mellan angränsande ramar och syntetiserar sedan nya ramar i en modifierad takt medan den justerar faserna så att på varandra följande ramar korresponderar korrekt. Resultatet är en kontinuerlig utgångssignal vars varaktighet har ändrats men vars frekvensinnehåll inte har gjort det. Eftersom ramarna är korta i förhållande till den typiska tonperioden för en mänsklig röst bevaras grundtonen i tal genom sträckningen. En bieffekt av algoritmen är att snabba transienter, som klicket av en konsonant, kan bli något suddiga när sträckningen är stor, eftersom ramöverlapps-syntesen introducerar en liten mängd medelvärdesbildning. Detta är inte ett fel i implementeringen; det är en inneboende egenskap hos famlijer av överlappnings-tillägg-algoritmer.

Ett diagram över överlappnings-tillägg-tidsträckningsprocessen: ingångslj-udramar till vänster, överlappande syntesramar i mitten och den sträckta utgångsvågformen till höger

Praktiska hastighetsintervall och kvalitetsgränser

För transkriberingarbete täcker två hastighetsvärden de flesta praktiska behov. Vid 0.75x sträcks tal till 133% av sin ursprungliga varaktighet. Konsonantkluster och snabba vokalövergångar blir lättare att separera och förändringen är tillräckligt liten för att algoritmen introducerar väldigt lite märkbar artefakt. De flesta lyssnare kan följa tal i denna takt utan att förlora den naturliga rytmen i meningen. Vid 0.5x sträcks ljudet till dubbelt sin ursprungliga längd. Detta är användbart för en enstaka mening eller ett kort svårt avsnitt, men det är för långsamt för kontinuerlig lyssning under flera minuter; koncentrationen sjunker innan orden är lösta. Under 0.5x försämras kvaliteten på utdata märkbart. Överlappnings-tillägg-syntesen börjar introducera ett fladdring eller fasighet på hållna vokaler och timningstecken mellan konsonanter och vokaler som bär prosodi blir förvrängda. atempo-filtret i ffmpeg tvingar fram ett minimum på 0.5x för ett enda pass, vilket återspeglar denna kvalitetsgräns. Värden under 0.5x kräver kedjning av två pass och artefaktnivån ökar därefter. För nästan alla transkriberingsfallen producerar att stanna vid 0.75x eller som mest 0.5x för korta segment ren, användbar utdata.

Gör det lokalt med audio-speed-verktyget

Verktyget audio-speed på den här webbplatsen körs helt i webbläsaren med ffmpeg kompilerat till WebAssembly. Du släpper din ljudfil på sidan, ställer in hastighetsmultiplikatorn och bearbetningen sker på din enhet. Inspelningen lämnar inte din maskin vid någon tidpunkt: ingen uppladdning, ingen server, ingen tredjepartstjänst. Detta spelar roll för inspelade samtal, intervjuer, medicinsk diktering, rättsliga förfaranden och vilket annat sammanhang där innehållet i ljudet är känsligt. Verktyget accepterar de vanliga ljudformat som hanteras av ffmpeg, inklusive MP3, WAV, M4A, OGG och FLAC. Utdata är en nedladdningsbar fil i den hastighet du valde. Eftersom bearbetningen körs lokalt beror den tid det tar på filens längd och enhetens hastighet. Några minuters ljud bearbetas typiskt på under en minut på en modern bärbar dator. Verktyget använder samma atempo-filter som beskrivs i den här artikeln, så de kvalitetsegenskaper som beskrivs ovan gäller direkt för vad du hör i utdata.

Verktyg i den här artikeln

Vanliga frågor

Ändrar det tonen att sänka hastigheten på ljud?

Det beror på metoden. Enkel hastighetsminskning för uppspelning ändrar tonen: vid 0.5x sjunker röster med en hel oktav. Verktyget audio-speed använder tidsträckning (atempo-filtret) som ändrar varaktighet utan att ändra ton, så röster stannar vid sin ursprungliga frekvens.

Vad är den lägsta hastigheten som fortfarande låter ren?

Vid 0.75x är utdata ren för de flesta inspelningar. Vid 0.5x är den acceptabel för korta avsnitt. Under 0.5x börjar överlappnings-tillägg-algoritmen introducera hörbara artefakter på hållna vokaler och konsonantövergångar. För transkriberingarbete ger att stanna vid eller ovanför 0.5x bäst resultat.

Laddas filen upp när jag använder audio-speed-verktyget?

Nej. Verktyget audio-speed körs helt i webbläsaren. Filen bearbetas lokalt på din enhet med WebAssembly. Inget skickas till någon server, så innehållet i din inspelning förblir privat.