Sem upload, 100% local, sem conta

Transcrever áudio, fala para texto no seu navegador

Solte uma gravação e obtenha uma transcrição em texto. Roda no seu dispositivo com um modelo Whisper pequeno baixado uma vez deste site; seu áudio nunca é enviado.

Como o Transcrever áudio · fala para texto funciona

Transcrição de Áudio transforma uma gravação em texto usando o Whisper, um modelo de reconhecimento de voz que roda inteiramente na aba do seu navegador via Transformers.js. Na primeira vez que você usar, o navegador baixa deste site o modelo e o mecanismo WebAssembly necessário (cerca de 68 MB no total) e os armazena em cache; depois disso, cada transcrição acontece no seu dispositivo, sem nenhum servidor envolvido e sem que o áudio saia da sua máquina.

O modelo usado aqui é o whisper-tiny.en: a variante menor do Whisper, quantizada e limitada ao inglês. Ele é rápido o suficiente para rodar numa aba do navegador e produz um primeiro rascunho útil, mas não é um serviço de transcrição profissional. Espere erros em nomes próprios, vocabulário técnico, sotaques fortes, ruído de fundo e vozes sobrepostas.

Como usar o Transcrever áudio · fala para texto, passo a passo

  1. Solte um arquivo de áudio (MP3, WAV, M4A, OGG ou as gravações WebM feitas pelo gravador de voz deste site).
  2. Aguarde o download único do mecanismo e do modelo (cerca de 68 MB) se for sua primeira transcrição neste dispositivo.
  3. Escolha texto simples (.txt) ou legendas com marcação de tempo (.srt) como formato de saída.
  4. Clique em transcrever e deixe o Whisper processar a gravação inteiramente no seu navegador.

Casos de uso comuns

  • Obter um rascunho escrito rápido de um memorando de voz gravado no celular antes de revisá-lo manualmente.
  • Transformar uma entrevista curta gravada em texto pesquisável sem enviá-la a um serviço de transcrição na nuvem.
  • Gerar um arquivo de legenda .srt inicial para um clipe curto, a ser corrigido depois.

Perguntas frequentes

Quão precisa é a transcrição?

Depende muito da qualidade do áudio. Um inglês claro, com um único falante, gravado perto do microfone e com pouco ruído de fundo é transcrito razoavelmente bem. Sotaques fortes, vozes sobrepostas, música ou ruído de fundo e vocabulário especializado aumentam os erros. É um modelo pequeno e quantizado, escolhido para rodar numa aba do navegador, então trate o resultado como um rascunho útil para revisar, não como uma transcrição final.

Funciona com outros idiomas além do inglês?

Não. Esta ferramenta usa o whisper-tiny.en, a variante do Whisper limitada ao inglês, escolhida por ser menor e mais precisa em inglês do que o modelo tiny multilíngue. Áudio em outros idiomas vai gerar resultados fracos ou sem sentido.

Meu áudio é enviado para algum lugar?

Não. A gravação é decodificada e processada inteiramente dentro da aba do seu navegador usando a Web Audio API e um modelo Whisper local. Nenhum arquivo de áudio, nem nenhum texto transcrito, é enviado a um servidor.

Quanto tempo leva a transcrição?

Depende da CPU do seu dispositivo e da duração da gravação, já que tudo roda localmente em vez de em um servidor. Clipes curtos (menos de um minuto) costumam terminar em poucos segundos; gravações longas, como uma entrevista de uma hora, levam proporcionalmente mais tempo.