Sem upload, 100% local, sem conta

Artigo

Por que você não consegue copiar texto de alguns PDFs

Tente selecionar uma linha em um PDF e as palavras destacam normalmente, prontas para copiar. Tente o mesmo gesto em outro PDF e nada acontece, ou o cursor pega a página inteira como se fosse uma fotografia, porque é exatamente isso que ela é. Dois arquivos que parecem idênticos na tela podem ser construídos de forma completamente diferente por baixo. Veja como saber qual tipo você tem, e o que fazer com o que resiste a ser copiado.

Dois tipos diferentes de página de PDF

Um PDF pode guardar uma página de duas formas bem diferentes. Em um PDF baseado em texto, cada letra é um objeto de caractere com um valor Unicode, uma fonte e uma posição, do mesmo jeito que uma página web guarda texto: um visualizador consegue selecioná-lo, pesquisá-lo, e um leitor de tela consegue ler em voz alta. Em um PDF baseado em imagem, a página é uma única imagem plana, geralmente produzida por um scanner, um fax, ou uma etapa de 'imprimir como PDF' aplicada a uma foto de um documento. As letras parecem iguais aos seus olhos, mas para o formato do arquivo não há nenhum caractere embaixo, só pixels.

Comparação lado a lado: uma página de PDF baseada em texto com uma linha destacada e selecionável ao lado de uma página de PDF baseada em imagem em que o texto de aparência igual é uma única imagem plana sem seleção

Um jeito rápido de saber qual você tem

Pressione Ctrl+F ou Cmd+F e pesquise uma palavra que você consegue ver claramente na página. Se a busca encontrar e destacar, a página tem uma camada de texto real. Se a busca não encontrar nada em nenhum lugar do documento, a página é uma imagem, não importa quão nítida ou quanto pareça um documento digitado. Arrastar o mouse para selecionar uma linha dá a mesma resposta: um destaque contra uma simples seleção retangular.

Reconstruindo o texto com OCR

O reconhecimento óptico de caracteres (OCR) lê os pixels de uma página baseada em imagem e compara as formas com um modelo treinado de letras para um determinado idioma, depois reconstrói uma camada de texto com os caracteres reconhecidos posicionados onde apareceram. Uma ferramenta como o OCR faz isso inteiramente no navegador: nada é enviado, e o resultado é um arquivo de texto simples que você pode pesquisar, copiar ou editar. A precisão depende da origem: uma digitalização limpa, reta e de alta resolução em um idioma bem suportado reconhece de forma confiável, enquanto uma página torta, borrada, de baixo contraste ou manuscrita produz mais erros, às vezes um caractere errado ou uma palavra mal lida.

Diagrama de processamento: os pixels de uma página digitalizada passam pelo reconhecimento de caracteres do OCR e saem como uma camada de texto reconstruída e posicionada

Quando o arquivo já tem texto mas a extração parece errada

Se o seu PDF realmente tem uma camada de texto real mas uma ferramenta como PDF para texto produz texto em uma ordem estranha, com colunas misturadas ou espaçamento colapsado, isso é um problema diferente, sem relação: os objetos de texto existem, mas a ordem de leitura deles na página não foi armazenada do jeito que um script naturalmente espera. Isso é uma peculiaridade de layout para arrumar depois da extração, não um sinal de que o texto está faltando, e não precisa de OCR para corrigir.

Ferramentas neste artigo

Perguntas frequentes

Meu PDF parece um documento digitado normal mas ainda assim não consigo selecionar nenhum texto. Por quê?

É bem provável que seja uma página digitalizada ou fotografada salva como PDF, ou um documento achatado em imagem de propósito. Visualmente pode ser indistinguível de um PDF baseado em texto; a diferença só aparece quando você tenta pesquisar ou selecionar. Passá-lo pelo OCR reconstrói uma camada de texto real e selecionável a partir dos pixels.

O OCR funciona igualmente bem em todos os idiomas?

Não. A precisão depende de existir um modelo treinado para aquele idioma e alfabeto, e da qualidade da digitalização. Idiomas bem suportados em uma digitalização limpa e reta reconhecem de forma confiável; letra manuscrita, imagens de baixa resolução, ou idiomas com menos dados de treinamento produzem mais erros. O resultado do OCR é sempre uma transcrição de melhor esforço, que vale a pena revisar rapidamente antes de confiar nela.

Fontes