Sem upload, 100% local, sem conta

Artigo

Desacelerando o áudio para transcrição

Falantes rápidos, sotaques desconhecidos e múltiplas vozes sobrepostas são os três principais motivos pelos quais uma transcrição trava. Desacelerar a gravação dá tempo para capturar o que foi dito. O problema é que a desaceleração ingênua de reprodução também diminui o tom de cada voz, tornando a fala mais difícil de seguir em vez de mais fácil. Este artigo explica a diferença entre a simples redução de velocidade e o time-stretching com preservação de tom, e cobre as faixas práticas que realmente ajudam.

Por que desacelerar ajuda

A fala humana carrega muita informação em uma janela curta. Um falante rápido pode entregar 200 palavras por minuto ou mais, e nessa taxa, o ouvido tem pouco tempo para resolver fonemas individuais antes que a próxima sílaba chegue. Desacelerar o áudio dá ao cérebro mais tempo de processamento por sílaba, o que importa mais em três situações: um falante com sotaque desconhecido cujo mapeamento de fonemas difere do que você espera; uma passagem técnica densa onde cada palavra carrega significado e um único erro de audição produz um termo errado; e gravações com duas ou mais vozes sobrepostas onde o ouvido tem que rastrear fluxos separados de uma vez. Em todos os três casos, o objetivo não é ouvir algo que não estava lá, mas dar a si mesmo tempo suficiente para ouvir com precisão o que já foi gravado. Uma velocidade de reprodução de 0.75x muitas vezes é suficiente para um sotaque ou uma passagem densa. Uma taxa de 0.5x é útil para uma curta seção onde as primeiras tentativas não resolveram as palavras.

Uma exibição de forma de onda mostrando um segmento de fala, com um eixo de tempo esticado horizontalmente para representar a reprodução mais lenta, com limites de sílabas visíveis como picos e vales

Velocidade e tom: por que a desaceleração ingênua não funciona

A maneira mais simples de desacelerar o áudio é reproduzir as amostras em uma taxa mais baixa do que foram gravadas. É assim que as antigas fitas cassete desaceleravam: girar a fita mais devagar e tanto a duração quanto o tom caem juntos. Em 0.75x, as vozes caem cerca de uma terça menor. Em 0.5x, caem uma oitava inteira. O resultado é a familiar distorção lenta e grave que faz a fala soar antinatural e, paradoxalmente, mais difícil de entender porque as frequências formantes que distinguem as vogais foram todas deslocadas para baixo. A abordagem correta é o time-stretching: alterar a duração do áudio sem alterar as frequências. O tom de cada voz permanece o mesmo; apenas a taxa na qual as sílabas chegam muda. Essa é a abordagem usada pela ferramenta audio-speed e pela maioria dos softwares dedicados de transcrição. O resultado perceptível é que uma gravação desacelerada soa como o mesmo falante falando em um ritmo mais lento, que é exatamente o que você precisa quando o objetivo é a transcrição precisa.

Como o time-stretching funciona: a abordagem atempo

O algoritmo mais amplamente utilizado para time-stretching em ferramentas de áudio práticas é baseado em vocoder de fase, e sua implementação comum no ffmpeg é o filtro atempo. O áudio de entrada é dividido em quadros curtos e sobrepostos, tipicamente de 20 a 40 milissegundos cada. O algoritmo analisa as relações de fase entre quadros adjacentes, depois sintetiza novos quadros em uma taxa modificada enquanto ajusta as fases para que quadros sucessivos se alinhem corretamente. O resultado é um sinal de saída contínuo cuja duração mudou, mas cujo conteúdo de frequência não mudou. Como os quadros são curtos em relação ao período típico de tom de uma voz humana, a frequência fundamental da fala é preservada durante o esticamento. Um efeito colateral do algoritmo é que transientes rápidos, como o clique de uma consoante, podem ser ligeiramente borrados quando o esticamento é grande, porque a síntese de sobreposição de quadros introduz uma pequena quantidade de média. Isso não é um defeito na implementação; é uma propriedade inerente da família de algoritmos overlap-add.

Um diagrama do processo de time-stretching overlap-add: quadros de áudio de entrada à esquerda, quadros de síntese sobrepostos no centro e a forma de onda de saída esticada à direita

Faixas práticas de velocidade e limites de qualidade

Para trabalho de transcrição, dois valores de velocidade cobrem a maioria das necessidades práticas. Em 0.75x, a fala é esticada para 133% de sua duração original. Grupos de consoantes e transições rápidas de vogais ficam mais fáceis de separar, e a mudança é pequena o suficiente para que o algoritmo introduza muito pouco artefato perceptível. A maioria dos ouvintes consegue acompanhar a fala nessa taxa sem perder o ritmo natural da frase. Em 0.5x, o áudio é esticado para o dobro do seu comprimento original. Isso é útil para uma única frase ou uma passagem curta difícil, mas é lento demais para escuta contínua por vários minutos; a concentração cai antes de as palavras serem resolvidas. Abaixo de 0.5x, a qualidade da saída degrada visivelmente. A síntese overlap-add começa a introduzir um tremido ou efeito de fase em vogais sustentadas, e as pistas de timing entre consoantes e vogais que carregam prosódia ficam distorcidas. O filtro atempo no ffmpeg impõe um mínimo de 0.5x para uma única passagem, o que reflete esse limite de qualidade. Valores abaixo de 0.5x requerem encadeamento de duas passagens, e o nível de artefato aumenta proporcionalmente. Para quase todos os casos de uso de transcrição, ficar em 0.75x ou no máximo 0.5x para segmentos curtos produz saída limpa e utilizável.

Fazendo localmente com a ferramenta audio-speed

A ferramenta audio-speed neste site roda inteiramente no navegador usando ffmpeg compilado para WebAssembly. Você solta seu arquivo de áudio na página, define o multiplicador de velocidade e o processamento acontece no seu dispositivo. A gravação não sai da sua máquina em nenhum momento: sem envio, sem servidor, sem serviço de terceiros. Isso importa para conversas gravadas, entrevistas, ditados médicos, processos legais e qualquer outro contexto onde o conteúdo do áudio é sensível. A ferramenta aceita os formatos de áudio comuns suportados pelo ffmpeg, incluindo MP3, WAV, M4A, OGG e FLAC. A saída é um arquivo para download na velocidade que você escolheu. Como o processamento é executado localmente, o tempo que leva depende do comprimento do arquivo e da velocidade do seu dispositivo. Alguns minutos de áudio geralmente processam em bem menos de um minuto em um laptop moderno. A ferramenta usa o mesmo filtro atempo descrito neste artigo, portanto as características de qualidade descritas acima se aplicam diretamente ao que você ouvirá na saída.

Ferramentas neste artigo

Perguntas frequentes

Desacelerar o áudio também mudará o tom?

Depende do método. A simples redução da taxa de reprodução muda o tom: em 0.5x, as vozes caem uma oitava inteira. A ferramenta audio-speed usa time-stretching (o filtro atempo) que muda a duração sem mudar o tom, portanto as vozes permanecem em sua frequência original.

Qual é a velocidade mais lenta que ainda soa limpa?

Em 0.75x a saída é limpa para a maioria das gravações. Em 0.5x é aceitável para passagens curtas. Abaixo de 0.5x, o algoritmo overlap-add começa a introduzir artefatos audíveis em vogais sustentadas e transições de consoantes. Para trabalho de transcrição, ficar em ou acima de 0.5x dá os melhores resultados.

O arquivo é enviado quando eu uso a ferramenta audio-speed?

Não. A ferramenta audio-speed roda inteiramente no navegador. O arquivo é processado localmente no seu dispositivo usando WebAssembly. Nada é enviado para nenhum servidor, portanto o conteúdo da sua gravação permanece privado.