Χωρίς μεταφόρτωση, 100% τοπικά, χωρίς λογαριασμό

Απομαγνητοφώνηση ήχου, ομιλία σε κείμενο στο πρόγραμμα περιήγησής σας

Αφήστε μια ηχογράφηση και πάρτε μια μεταγραφή κειμένου. Τρέχει στη συσκευή σας με ένα μικρό μοντέλο Whisper που κατεβαίνει μία φορά από αυτόν τον ιστότοπο· ο ήχος σας δεν ανεβαίνει ποτέ.

Πώς λειτουργεί το Απομαγνητοφώνηση ήχου · ομιλία σε κείμενο

Η Απομαγνητοφώνηση Ήχου (Audio Transcribe) μετατρέπει μια ηχογράφηση σε κείμενο χρησιμοποιώντας το Whisper, ένα μοντέλο αναγνώρισης ομιλίας που εκτελείται εξ ολοκλήρου μέσα στην καρτέλα του browser σας μέσω του Transformers.js. Την πρώτη φορά που το εκτελείτε, ο browser σας κατεβάζει το μοντέλο και τον μηχανισμό WebAssembly που χρειάζεται (συνολικά περίπου 68 MB) από αυτόν τον ιστότοπο, και έπειτα τα αποθηκεύει στην cache· κάθε απομαγνητοφώνηση μετά από αυτό γίνεται στη συσκευή σας χωρίς κανέναν server και χωρίς να φεύγει ποτέ ήχος από το μηχάνημά σας. Αυτό είναι ο ίδιος συμβιβασμός με τα εργαλεία OCR και ήχου αυτού του ιστότοπου: μια πραγματική εφάπαξ λήψη για πραγματική επεξεργασία εκτός σύνδεσης, όχι ένας διαφημιστικός ισχυρισμός.

Το μοντέλο που χρησιμοποιείται εδώ είναι το whisper-tiny.en: η μικρότερη, κβαντισμένη παραλλαγή Whisper μόνο για αγγλικά. Είναι αρκετά γρήγορο ώστε να τρέχει σε μια καρτέλα browser και παράγει ένα χρήσιμο πρώτο προσχέδιο, αλλά δεν είναι μια επαγγελματική υπηρεσία απομαγνητοφώνησης. Περιμένετε λάθη σε κύρια ονόματα, τεχνικό λεξιλόγιο, έντονες προφορές, θόρυβο περιβάλλοντος και ομιλητές που αλληλεπικαλύπτονται. Ηχογραφήσεις μεγαλύτερες από περίπου 30 δευτερόλεπτα επεξεργάζονται σε επικαλυπτόμενα τμήματα ώστε να απομαγνητοφωνηθεί ολόκληρο το αρχείο, αλλά μια συνέντευξη μιας ώρας εξακολουθεί να χρειάζεται πραγματικό υπολογιστικό χρόνο αφού όλα εκτελούνται στη δική σας συσκευή αντί σε ένα κέντρο δεδομένων.

Απομαγνητοφώνηση ήχου · ομιλία σε κείμενο: οδηγός βήμα προς βήμα

  1. Αφήστε ένα αρχείο ήχου (MP3, WAV, M4A, OGG ή τις ηχογραφήσεις WebM που παράγει η Ηχογράφηση Φωνής αυτού του ιστότοπου).
  2. Περιμένετε την εφάπαξ λήψη μηχανισμού και μοντέλου (περίπου 68 MB) αν αυτή είναι η πρώτη σας απομαγνητοφώνηση σε αυτή τη συσκευή.
  3. Επιλέξτε απλό κείμενο (.txt) ή υπότιτλους με χρονοσφραγίδες (.srt) ως μορφή εξόδου.
  4. Πατήστε απομαγνητοφώνηση και αφήστε το Whisper να επεξεργαστεί την ηχογράφηση πλήρως μέσα στην καρτέλα του browser σας.
  5. Αντιγράψτε το κείμενο απευθείας ή κατεβάστε το αρχείο .txt/.srt μόλις είναι έτοιμο.

Συνήθεις περιπτώσεις χρήσης

  • Λήψη ενός πρόχειρου γραπτού προσχεδίου μιας φωνητικής σημείωσης που ηχογραφήθηκε στο κινητό σας πριν το επεξεργαστείτε με το χέρι.
  • Μετατροπή μιας σύντομης ηχογραφημένης συνέντευξης σε αναζητήσιμο κείμενο χωρίς να την ανεβάσετε σε μια υπηρεσία απομαγνητοφώνησης cloud.
  • Δημιουργία ενός αρχικού αρχείου υποτίτλων .srt για ένα σύντομο βίντεο, προς διόρθωση αργότερα.
  • Ηχογράφηση μιας γρήγορης φωνητικής σημείωσης με την Ηχογράφηση Φωνής αυτού του ιστότοπου, και στη συνέχεια απομαγνητοφώνησή της στην ίδια καρτέλα browser.
  • Λήψη μιας πρώτης απομαγνητοφώνησης μιας διάλεξης ή ηχογράφησης συνάντησης όταν δεν απαιτείται τέλεια ακρίβεια.

Συχνές ερωτήσεις

Πόσο ακριβής είναι η απομαγνητοφώνηση;

Εξαρτάται σε μεγάλο βαθμό από την ποιότητα του ήχου. Καθαρά αγγλικά ενός μόνο ομιλητή, ηχογραφημένα κοντά στο μικρόφωνο με λίγο θόρυβο περιβάλλοντος, απομαγνητοφωνούνται αρκετά καλά. Προφορές, ταυτόχρονη ομιλία, μουσική ή θόρυβος στο παρασκήνιο, και εξειδικευμένο λεξιλόγιο (ονόματα, ορολογία, ακρωνύμια) αυξάνουν όλα τα λάθη. Πρόκειται για ένα μικρό, κβαντισμένο μοντέλο που επιλέχθηκε ώστε να τρέχει μέσα σε μια καρτέλα browser, όχι το μεγαλύτερο μοντέλο Whisper, οπότε αντιμετωπίστε την έξοδο ως χρήσιμο προσχέδιο προς έλεγχο και διόρθωση, όχι ως τελική απομαγνητοφώνηση.

Λειτουργεί με άλλες γλώσσες εκτός από τα αγγλικά;

Όχι. Αυτό το εργαλείο χρησιμοποιεί το whisper-tiny.en, την παραλλαγή Whisper μόνο για αγγλικά, που επιλέχθηκε επειδή είναι μικρότερη και πιο ακριβής στα αγγλικά από το πολυγλωσσικό tiny μοντέλο. Ήχος σε άλλες γλώσσες θα παράγει κακά ή ασυνάρτητα αποτελέσματα. Η υποστήριξη για άλλες γλώσσες δεν είναι επί του παρόντος διαθέσιμη.

Γιατί χρειάζεται να κατέβει κάτι πριν λειτουργήσει;

Το μοντέλο αναγνώρισης ομιλίας και ο μηχανισμός WebAssembly που το εκτελεί (περίπου 68 MB συνολικά) δεν είναι ενσωματωμένα στη σελίδα· κατεβαίνουν μία φορά από αυτόν τον ιστότοπο και αποθηκεύονται στην cache του browser σας, παρόμοια με το πώς το εργαλείο OCR κατεβάζει ένα μοντέλο γλώσσας. Μετά από αυτή την πρώτη λήψη, η απομαγνητοφώνηση λειτουργεί εντελώς εκτός σύνδεσης. Τίποτα δεν λαμβάνεται από κανένα CDN τρίτου μέρους.

Ανεβαίνει ο ήχος μου κάπου;

Όχι. Η ηχογράφηση αποκωδικοποιείται και επεξεργάζεται εξ ολοκλήρου μέσα στην καρτέλα του browser σας χρησιμοποιώντας το Web Audio API και ένα τοπικό μοντέλο Whisper. Κανένα αρχείο ήχου, και κανένα απομαγνητοφωνημένο κείμενο, δεν αποστέλλεται ποτέ σε έναν server. Μπορείτε να αποσυνδεθείτε από το δίκτυο αφού το μοντέλο έχει κατέβει και η απομαγνητοφώνηση εξακολουθεί να λειτουργεί.

Πόσο χρόνο χρειάζεται η απομαγνητοφώνηση;

Εξαρτάται από τον επεξεργαστή (CPU) της συσκευής σας και τη διάρκεια της ηχογράφησης, αφού όλα εκτελούνται τοπικά αντί σε υλικό server. Σύντομα κλιπ (κάτω από ένα λεπτό) συνήθως ολοκληρώνονται σε λίγα δευτερόλεπτα έως λιγότερο από ένα λεπτό. Μεγάλες ηχογραφήσεις, όπως μια συνέντευξη μιας ώρας, χρειάζονται ανάλογα περισσότερο χρόνο και θα κρατήσουν την καρτέλα του browser σας απασχολημένη για όλο αυτό το διάστημα· κρατήστε την καρτέλα ανοιχτή και μην πλοηγηθείτε αλλού όσο δουλεύει.

Ποια είναι η διαφορά μεταξύ των εξόδων .txt και .srt;

Το αρχείο .txt είναι το απλό απομαγνητοφωνημένο κείμενο χωρίς χρονοσφραγίδες, χρήσιμο για ανάγνωση ή επικόλληση αλλού. Το αρχείο .srt είναι μια τυπική μορφή υποτίτλων με ένα εύρος χρονοσφραγίδας για κάθε ομιλούμενο τμήμα, χρήσιμο για την προσθήκη λεζάντων σε ένα βίντεο. Και τα δύο παράγονται από την ίδια απομαγνητοφώνηση· επιλέξτε όποιο ταιριάζει σε αυτό που χρειάζεστε να κάνετε στη συνέχεια.