Comment fonctionne Transcription audio · voix vers texte
Transcription audio transforme un enregistrement en texte grâce à Whisper, un modèle de reconnaissance vocale qui tourne entièrement dans l'onglet de ton navigateur via Transformers.js. Au premier lancement, le navigateur télécharge depuis ce site le modèle et le moteur WebAssembly nécessaires (environ 68 Mo au total), puis les met en cache ; toutes les transcriptions suivantes se font sur ton appareil, sans serveur et sans que l'audio ne quitte jamais ta machine. C'est le même compromis que pour l'OCR et les autres outils audio de ce site : un vrai téléchargement ponctuel pour un vrai traitement hors ligne, pas un argument marketing.
Le modèle utilisé ici est whisper-tiny.en : la plus petite variante de Whisper, quantifiée et réservée à l'anglais. Elle est assez rapide pour tourner dans un onglet de navigateur et produit un premier brouillon utile, mais ce n'est pas un service de transcription professionnel. Attends-toi à des erreurs sur les noms propres, le vocabulaire technique, les accents marqués, le bruit de fond et les voix qui se chevauchent. Les enregistrements de plus de 30 secondes environ sont traités par fragments qui se chevauchent pour couvrir tout le fichier, mais une interview d'une heure demande un vrai temps de calcul puisque tout tourne sur ton appareil plutôt que dans un centre de données.