Πώς λειτουργεί το Απομαγνητοφώνηση ήχου · ομιλία σε κείμενο
Η Απομαγνητοφώνηση Ήχου (Audio Transcribe) μετατρέπει μια ηχογράφηση σε κείμενο χρησιμοποιώντας το Whisper, ένα μοντέλο αναγνώρισης ομιλίας που εκτελείται εξ ολοκλήρου μέσα στην καρτέλα του browser σας μέσω του Transformers.js. Την πρώτη φορά που το εκτελείτε, ο browser σας κατεβάζει το μοντέλο και τον μηχανισμό WebAssembly που χρειάζεται (συνολικά περίπου 68 MB) από αυτόν τον ιστότοπο, και έπειτα τα αποθηκεύει στην cache· κάθε απομαγνητοφώνηση μετά από αυτό γίνεται στη συσκευή σας χωρίς κανέναν server και χωρίς να φεύγει ποτέ ήχος από το μηχάνημά σας. Αυτό είναι ο ίδιος συμβιβασμός με τα εργαλεία OCR και ήχου αυτού του ιστότοπου: μια πραγματική εφάπαξ λήψη για πραγματική επεξεργασία εκτός σύνδεσης, όχι ένας διαφημιστικός ισχυρισμός.
Το μοντέλο που χρησιμοποιείται εδώ είναι το whisper-tiny.en: η μικρότερη, κβαντισμένη παραλλαγή Whisper μόνο για αγγλικά. Είναι αρκετά γρήγορο ώστε να τρέχει σε μια καρτέλα browser και παράγει ένα χρήσιμο πρώτο προσχέδιο, αλλά δεν είναι μια επαγγελματική υπηρεσία απομαγνητοφώνησης. Περιμένετε λάθη σε κύρια ονόματα, τεχνικό λεξιλόγιο, έντονες προφορές, θόρυβο περιβάλλοντος και ομιλητές που αλληλεπικαλύπτονται. Ηχογραφήσεις μεγαλύτερες από περίπου 30 δευτερόλεπτα επεξεργάζονται σε επικαλυπτόμενα τμήματα ώστε να απομαγνητοφωνηθεί ολόκληρο το αρχείο, αλλά μια συνέντευξη μιας ώρας εξακολουθεί να χρειάζεται πραγματικό υπολογιστικό χρόνο αφού όλα εκτελούνται στη δική σας συσκευή αντί σε ένα κέντρο δεδομένων.