Χωρίς μεταφόρτωση, 100% τοπικά, χωρίς λογαριασμό

Άρθρο

Επιβράδυνση ήχου για μεταγραφή

Οι γρήγοροι ομιλητές, οι άγνωστες προφορές και πολλαπλές επικαλυπτόμενες φωνές είναι οι τρεις κύριοι λόγοι που μια μεταγραφή σταματά. Η επιβράδυνση της εγγραφής δίνει χρόνο για να πιαστεί αυτό που ειπώθηκε. Το πρόβλημα είναι ότι η απλή επιβράδυνση αναπαραγωγής χαμηλώνει επίσης τον τόνο κάθε φωνής, κάνοντας την ομιλία πιο δύσκολη να ακολουθηθεί αντί ευκολότερη. Αυτό το άρθρο εξηγεί τη διαφορά μεταξύ απλής μείωσης ταχύτητας και χρονικής διαστολής με διατήρηση τόνου, και καλύπτει τα πρακτικά εύρη που πραγματικά βοηθούν.

Γιατί η επιβράδυνση βοηθά

Η ανθρώπινη ομιλία μεταφέρει πολλές πληροφορίες σε σύντομο χρόνο. Ένας γρήγορος ομιλητής μπορεί να εκφέρει 200 λέξεις ανά λεπτό ή περισσότερο, και σε αυτόν τον ρυθμό το αυτί έχει λίγο χρόνο να αναγνωρίσει μεμονωμένα φωνήματα πριν φτάσει η επόμενη συλλαβή. Η επιβράδυνση του ήχου δίνει στον εγκέφαλο περισσότερο χρόνο επεξεργασίας ανά συλλαβή, κάτι που έχει μεγαλύτερη σημασία σε τρεις περιπτώσεις: ομιλητής με άγνωστη προφορά που αντιστοίχιση φωνημάτων διαφέρει από αυτό που περιμένετε. Πυκνό τεχνικό απόσπασμα όπου κάθε λέξη έχει σημασία και μια λανθασμένη ακρόαση παράγει λάθος όρο. Εγγραφές με δύο ή περισσότερες επικαλυπτόμενες φωνές όπου το αυτί πρέπει να παρακολουθεί ξεχωριστές ροές ταυτόχρονα. Και στις τρεις περιπτώσεις, στόχος δεν είναι να ακούσετε κάτι που δεν ήταν εκεί, αλλά να έχετε αρκετό χρόνο για να ακούσετε με ακρίβεια αυτό που ήδη έχει εγγραφεί. Ρυθμός αναπαραγωγής 0.75x συχνά αρκεί για μια προφορά ή ένα πυκνό απόσπασμα. Ρυθμός 0.5x είναι χρήσιμος για ένα σύντομο τμήμα όπου οι πρώτες επαναλήψεις δεν έχουν αποκωδικοποιήσει τις λέξεις.

Εμφάνιση κυματομορφής που δείχνει ένα τμήμα ομιλίας, με τον άξονα χρόνου τεντωμένο οριζόντια για να αναπαριστά πιο αργή αναπαραγωγή, με όρια συλλαβών ορατά ως κορυφές και κοιλάδες

Ταχύτητα και τόνος: γιατί η απλή επιβράδυνση δεν λειτουργεί

Ο απλούστερος τρόπος για να επιβραδύνετε τον ήχο είναι να αναπαράγετε τα δείγματα με χαμηλότερο ρυθμό από αυτόν που εγγράφηκαν. Έτσι επιβράδυναν οι παλιές κασετόφωνοι: γυρίστε την ταινία πιο αργά και τόσο η διάρκεια όσο και ο τόνος μειώνονται μαζί. Στο 0.75x, οι φωνές κατεβαίνουν κατά περίπου ένα ελάσσον τρίτο. Στο 0.5x, κατεβαίνουν μια πλήρη οκτάβα. Το αποτέλεσμα είναι η γνωστή αργή, βαριά παραμόρφωση που κάνει την ομιλία να ακούγεται αφύσικη και, παραδόξως, πιο δύσκολη να κατανοηθεί, επειδή οι συχνότητες formant που διακρίνουν τα φωνήεντα έχουν όλες μετατοπιστεί προς τα κάτω. Η σωστή προσέγγιση είναι η χρονική διαστολή: αλλαγή της διάρκειας του ήχου χωρίς αλλαγή των συχνοτήτων. Ο τόνος κάθε φωνής παραμένει ίδιος. Αλλάζει μόνο ο ρυθμός άφιξης των συλλαβών. Αυτή είναι η προσέγγιση που χρησιμοποιεί το εργαλείο audio-speed και τα περισσότερα ειδικά λογισμικά μεταγραφής. Το αποτέλεσμα αντίληψης είναι ότι μια επιβραδυμένη εγγραφή ακούγεται σαν ο ίδιος ομιλητής να μιλά με πιο αργό ρυθμό, κάτι που είναι ακριβώς αυτό που χρειάζεστε για ακριβή μεταγραφή.

Πώς λειτουργεί η χρονική διαστολή: η προσέγγιση atempo

Ο πιο ευρέως χρησιμοποιούμενος αλγόριθμος για χρονική διαστολή σε πρακτικά εργαλεία ήχου βασίζεται στο phase vocoding, και η κοινή υλοποίηση του στο ffmpeg είναι το φίλτρο atempo. Ο ήχος εισόδου χωρίζεται σε σύντομα επικαλυπτόμενα πλαίσια, συνήθως 20 έως 40 χιλιοστά του δευτερολέπτου το καθένα. Ο αλγόριθμος αναλύει τις σχέσεις φάσης μεταξύ διαδοχικών πλαισίων, στη συνέχεια συνθέτει νέα πλαίσια με τροποποιημένο ρυθμό προσαρμόζοντας τις φάσεις ώστε τα διαδοχικά πλαίσια να ευθυγραμμίζονται σωστά. Το αποτέλεσμα είναι ένα συνεχές σήμα εξόδου του οποίου η διάρκεια έχει αλλάξει αλλά το φασματικό περιεχόμενο όχι. Επειδή τα πλαίσια είναι σύντομα σε σχέση με την τυπική περίοδο τόνου της ανθρώπινης φωνής, η θεμελιώδης συχνότητα της ομιλίας διατηρείται κατά τη διαστολή. Μία παρενέργεια του αλγορίθμου είναι ότι οι γρήγορες μεταβάσεις, όπως ο κλικ ενός συμφώνου, μπορεί να θολωθούν ελαφρά όταν η διαστολή είναι μεγάλη, επειδή η σύνθεση με επικάλυψη πλαισίων εισάγει μια μικρή ισοπέδωση. Αυτό δεν είναι ελάττωμα στην υλοποίηση. Είναι εγγενής ιδιότητα της οικογένειας αλγορίθμων overlap-add.

Διάγραμμα της διαδικασίας χρονικής διαστολής overlap-add: πλαίσια ήχου εισόδου αριστερά, επικαλυπτόμενα πλαίσια σύνθεσης στο κέντρο, και η διαστελλόμενη κυματομορφή εξόδου δεξιά

Πρακτικές περιοχές ταχύτητας και όρια ποιότητας

Για μεταγραφή, δύο τιμές ταχύτητας καλύπτουν τις περισσότερες πρακτικές ανάγκες. Στο 0.75x, η ομιλία διαστέλλεται στο 133% της αρχικής διάρκειας. Οι συμφωνικές συστάδες και οι γρήγορες μεταβάσεις φωνηέντων γίνονται ευκολότερο να διαχωριστούν, και η αλλαγή είναι αρκετά μικρή ώστε ο αλγόριθμος να εισάγει ελάχιστα αντιληπτά artifacts. Οι περισσότεροι ακροατές μπορούν να παρακολουθούν ομιλία σε αυτόν τον ρυθμό χωρίς να χάνουν τον φυσικό ρυθμό της πρότασης. Στο 0.5x, ο ήχος διαστέλλεται στο διπλάσιο της αρχικής διάρκειας. Αυτό είναι χρήσιμο για μία μόνο πρόταση ή ένα σύντομο δύσκολο απόσπασμα, αλλά είναι υπερβολικά αργό για συνεχή ακρόαση επί αρκετά λεπτά. Η συγκέντρωση πέφτει πριν αποκωδικοποιηθούν οι λέξεις. Κάτω από 0.5x, η ποιότητα εξόδου υποβαθμίζεται αισθητά. Η σύνθεση overlap-add αρχίζει να εισάγει μια τρεμόπαιγμα ή phasiness σε παρατεταμένα φωνήεντα, και οι χρονικές ενδείξεις μεταξύ συμφώνων και φωνηέντων που φέρουν την προσωδία παραμορφώνονται. Το φίλτρο atempo στο ffmpeg επιβάλλει ελάχιστη τιμή 0.5x για ένα πέρασμα, κάτι που αντικατοπτρίζει αυτό το όριο ποιότητας. Τιμές κάτω από 0.5x απαιτούν αλυσίδωση δύο περασμάτων, και το επίπεδο artifacts αυξάνεται ανάλογα. Για σχεδόν όλες τις χρήσεις μεταγραφής, η παραμονή στο 0.75x ή κατ'ανώτατο στο 0.5x για σύντομα τμήματα παράγει καθαρή, αξιοποιήσιμη έξοδο.

Τοπική επεξεργασία με το εργαλείο audio-speed

Το εργαλείο audio-speed σε αυτόν τον ιστότοπο εκτελείται εξ ολοκλήρου στον περιηγητή χρησιμοποιώντας ffmpeg μεταγλωττισμένο σε WebAssembly. Αποθέτετε το αρχείο ήχου στη σελίδα, ορίζετε τον πολλαπλασιαστή ταχύτητας, και η επεξεργασία γίνεται στη συσκευή σας. Η εγγραφή δεν αποχωρεί από τη μηχανή σας σε κανένα σημείο: χωρίς ανάρτηση, χωρίς διακομιστή, χωρίς τρίτη υπηρεσία. Αυτό έχει σημασία για εγγεγραμμένες συνομιλίες, συνεντεύξεις, ιατρική υπαγόρευση, νομικές διαδικασίες και οποιοδήποτε άλλο πλαίσιο όπου το περιεχόμενο του ήχου είναι ευαίσθητο. Το εργαλείο δέχεται τις συνηθισμένες μορφές ήχου που υποστηρίζει το ffmpeg, συμπεριλαμβανομένων MP3, WAV, M4A, OGG και FLAC. Η έξοδος είναι αρχείο για λήψη στην ταχύτητα που επιλέξατε. Επειδή η επεξεργασία τρέχει τοπικά, ο απαιτούμενος χρόνος εξαρτάται από τη διάρκεια του αρχείου και την ταχύτητα της συσκευής σας. Μερικά λεπτά ήχου επεξεργάζονται συνήθως σε πολύ λιγότερο από ένα λεπτό σε σύγχρονο φορητό υπολογιστή. Το εργαλείο χρησιμοποιεί το ίδιο φίλτρο atempo που περιγράφεται σε αυτό το άρθρο, οπότε τα χαρακτηριστικά ποιότητας που αναφέρονται παραπάνω ισχύουν απευθείας για ό,τι θα ακούσετε στην έξοδο.

Εργαλεία αυτού του άρθρου

Συχνές ερωτήσεις

Η επιβράδυνση ήχου αλλάζει και τον τόνο;

Εξαρτάται από τη μέθοδο. Η απλή μείωση ρυθμού αναπαραγωγής αλλάζει τον τόνο: στο 0.5x, οι φωνές κατεβαίνουν μια πλήρη οκτάβα. Το εργαλείο audio-speed χρησιμοποιεί χρονική διαστολή (το φίλτρο atempo) που αλλάζει τη διάρκεια χωρίς να αλλάζει τον τόνο, οπότε οι φωνές παραμένουν στην αρχική τους συχνότητα.

Ποια είναι η πιο αργή ταχύτητα που εξακολουθεί να ακούγεται καθαρά;

Στο 0.75x η έξοδος είναι καθαρή για τις περισσότερες εγγραφές. Στο 0.5x είναι αποδεκτή για σύντομα αποσπάσματα. Κάτω από 0.5x, ο αλγόριθμος overlap-add αρχίζει να εισάγει ακουστά artifacts σε παρατεταμένα φωνήεντα και μεταβάσεις συμφώνων. Για μεταγραφή, η παραμονή σε ή πάνω από 0.5x δίνει τα καλύτερα αποτελέσματα.

Ανεβαίνει το αρχείο όταν χρησιμοποιώ το εργαλείο audio-speed;

Όχι. Το εργαλείο audio-speed εκτελείται εξ ολοκλήρου στον περιηγητή. Το αρχείο επεξεργάζεται τοπικά στη συσκευή σας μέσω WebAssembly. Δεν αποστέλλεται τίποτε σε κανέναν διακομιστή, οπότε το περιεχόμενο της εγγραφής σας παραμένει ιδιωτικό.