Sin subida, 100% local, sin cuenta

Transcripción de audio, voz a texto en tu navegador

Suelta una grabación y obtén una transcripción en texto. Se ejecuta en tu dispositivo con un modelo Whisper pequeño descargado una vez desde este sitio; tu audio nunca se sube.

Cómo funciona Transcripción de audio · voz a texto

Transcripción de Audio convierte una grabación en texto usando Whisper, un modelo de reconocimiento de voz que se ejecuta enteramente en la pestaña de tu navegador mediante Transformers.js. La primera vez que lo uses, tu navegador descarga desde este sitio el modelo y el motor WebAssembly que necesita (unos 68 MB en total) y los guarda en caché; a partir de ahí, cada transcripción ocurre en tu dispositivo sin ningún servidor y sin que el audio salga nunca de tu máquina.

El modelo utilizado es whisper-tiny.en: la variante más pequeña de Whisper, cuantizada y limitada al inglés. Es lo bastante rápida para funcionar en una pestaña del navegador y produce un primer borrador útil, pero no es un servicio de transcripción profesional. Espera errores en nombres propios, vocabulario técnico, acentos marcados, ruido de fondo y voces superpuestas.

Cómo usar Transcripción de audio · voz a texto, paso a paso

  1. Suelta un archivo de audio (MP3, WAV, M4A, OGG o las grabaciones WebM del grabador de voz de este sitio).
  2. Espera la descarga única del motor y el modelo (unos 68 MB) si es tu primera transcripción en este dispositivo.
  3. Elige texto plano (.txt) o subtítulos con marcas de tiempo (.srt) como formato de salida.
  4. Pulsa transcribir y deja que Whisper procese la grabación por completo en tu navegador.

Casos de uso comunes

  • Obtener un borrador escrito rápido de una nota de voz grabada en el teléfono antes de corregirlo a mano.
  • Convertir una entrevista corta en texto localizable sin subirla a un servicio de transcripción en la nube.
  • Generar un archivo de subtítulos .srt de partida para un clip corto, para corregir después.

Preguntas frecuentes

¿Qué precisión tiene la transcripción?

Depende mucho de la calidad del audio. Un inglés claro, de un solo hablante, grabado cerca del micrófono y con poco ruido de fondo se transcribe razonablemente bien. Los acentos marcados, las voces superpuestas, la música o el ruido de fondo y el vocabulario especializado aumentan los errores. Es un modelo pequeño y cuantizado, elegido para poder funcionar en una pestaña del navegador, así que trata el resultado como un borrador útil que hay que revisar, no como una transcripción final.

¿Funciona con idiomas distintos del inglés?

No. Esta herramienta usa whisper-tiny.en, la variante de Whisper limitada al inglés, elegida porque es más pequeña y más precisa en inglés que el modelo tiny multilingüe. El audio en otros idiomas dará resultados pobres o incoherentes.

¿Se sube mi audio a algún sitio?

No. La grabación se decodifica y procesa por completo dentro de tu pestaña del navegador con la API Web Audio y un modelo Whisper local. Ningún archivo de audio, ni ningún texto transcrito, se envía nunca a un servidor.

¿Cuánto tarda la transcripción?

Depende de la CPU de tu dispositivo y de la duración de la grabación, ya que todo se ejecuta localmente en lugar de en un servidor. Los clips cortos (menos de un minuto) suelen terminar en pocos segundos; las grabaciones largas, como una entrevista de una hora, tardan proporcionalmente más.