Aucun upload, 100 % local, sans compte

Transcription audio, voix vers texte dans le navigateur

Dépose un enregistrement et récupère le texte transcrit. Tourne sur ton appareil avec un petit modèle Whisper téléchargé une fois depuis ce site ; ton audio n'est jamais envoyé.

Comment fonctionne Transcription audio · voix vers texte

Transcription audio transforme un enregistrement en texte grâce à Whisper, un modèle de reconnaissance vocale qui tourne entièrement dans l'onglet de ton navigateur via Transformers.js. Au premier lancement, le navigateur télécharge depuis ce site le modèle et le moteur WebAssembly nécessaires (environ 68 Mo au total), puis les met en cache ; toutes les transcriptions suivantes se font sur ton appareil, sans serveur et sans que l'audio ne quitte jamais ta machine. C'est le même compromis que pour l'OCR et les autres outils audio de ce site : un vrai téléchargement ponctuel pour un vrai traitement hors ligne, pas un argument marketing.

Le modèle utilisé ici est whisper-tiny.en : la plus petite variante de Whisper, quantifiée et réservée à l'anglais. Elle est assez rapide pour tourner dans un onglet de navigateur et produit un premier brouillon utile, mais ce n'est pas un service de transcription professionnel. Attends-toi à des erreurs sur les noms propres, le vocabulaire technique, les accents marqués, le bruit de fond et les voix qui se chevauchent. Les enregistrements de plus de 30 secondes environ sont traités par fragments qui se chevauchent pour couvrir tout le fichier, mais une interview d'une heure demande un vrai temps de calcul puisque tout tourne sur ton appareil plutôt que dans un centre de données.

Comment utiliser Transcription audio · voix vers texte, étape par étape

  1. Dépose un fichier audio (MP3, WAV, M4A, OGG ou les enregistrements WebM produits par l'enregistreur vocal de ce site).
  2. Patiente pendant le téléchargement ponctuel du moteur et du modèle (environ 68 Mo) si c'est ta première transcription sur cet appareil.
  3. Choisis le texte brut (.txt) ou les sous-titres horodatés (.srt) comme format de sortie.
  4. Lance la transcription et laisse Whisper traiter l'enregistrement entièrement dans ton onglet.
  5. Copie le texte affiché ou télécharge le fichier .txt/.srt une fois prêt.

Cas d'utilisation courants

  • Obtenir un brouillon écrit rapide d'un mémo vocal enregistré sur ton téléphone, avant de le corriger à la main.
  • Transformer une courte interview enregistrée en texte consultable sans l'envoyer à un service de transcription cloud.
  • Générer un fichier de sous-titres .srt de départ pour un court extrait, à corriger ensuite.
  • Enregistrer une note vocale rapide avec l'enregistreur vocal de ce site, puis la transcrire dans le même onglet.
  • Obtenir un premier jet de transcription d'un cours ou d'une réunion enregistrée quand une précision parfaite n'est pas nécessaire.

Questions fréquentes

La transcription est-elle fiable ?

Cela dépend beaucoup de la qualité de l'audio. Un enregistrement clair, en anglais, avec un seul locuteur près du micro et peu de bruit de fond donne un résultat correct. Les accents, les voix qui se chevauchent, la musique ou le bruit de fond et le vocabulaire spécialisé (noms propres, jargon, sigles) augmentent les erreurs. C'est un petit modèle quantifié choisi pour pouvoir tourner dans un onglet de navigateur, pas le plus grand modèle Whisper disponible : considère le résultat comme un brouillon utile à relire et corriger, pas une transcription finale.

Fonctionne-t-il avec des langues autres que l'anglais ?

Non. Cet outil utilise whisper-tiny.en, la variante de Whisper réservée à l'anglais, choisie car elle est plus petite et plus précise sur l'anglais que le modèle tiny multilingue. Un audio dans une autre langue donnera des résultats médiocres ou incohérents. Le support d'autres langues n'est pas disponible actuellement.

Pourquoi faut-il télécharger quelque chose avant que ça fonctionne ?

Le modèle de reconnaissance vocale et le moteur WebAssembly qui l'exécute (environ 68 Mo au total) ne sont pas intégrés à la page : ils sont récupérés une fois depuis ce site puis mis en cache par ton navigateur, comme l'outil OCR télécharge un modèle de langue. Après ce premier téléchargement, la transcription tourne entièrement hors ligne. Rien n'est récupéré depuis un CDN tiers.

Mon audio est-il envoyé quelque part ?

Non. L'enregistrement est décodé et traité entièrement dans ton onglet de navigateur avec l'API Web Audio et un modèle Whisper local. Aucun fichier audio, ni aucun texte transcrit, n'est jamais envoyé à un serveur. Tu peux couper ta connexion réseau une fois le modèle téléchargé et la transcription continue de fonctionner.

Combien de temps prend la transcription ?

Cela dépend du processeur de ton appareil et de la durée de l'enregistrement, puisque tout tourne en local plutôt que sur un serveur. Les courts extraits (moins d'une minute) se terminent généralement en quelques secondes à moins d'une minute. Les enregistrements longs, comme une interview d'une heure, prennent proportionnellement plus de temps et occupent ton onglet pendant ce laps de temps ; laisse l'onglet ouvert et ne le quitte pas pendant le traitement.

Quelle est la différence entre les sorties .txt et .srt ?

Le fichier .txt contient le texte transcrit brut, sans horodatage, pratique pour lire ou coller ailleurs. Le fichier .srt est un format de sous-titres standard avec une plage horaire pour chaque segment parlé, pratique pour ajouter des sous-titres à une vidéo. Les deux sont générés à partir de la même transcription : choisis celui qui correspond à ton besoin.