Artigo
Por que você não consegue copiar texto de alguns PDFs
Tente selecionar uma linha em um PDF e as palavras destacam normalmente, prontas para copiar. Tente o mesmo gesto em outro PDF e nada acontece, ou o cursor pega a página inteira como se fosse uma fotografia, porque é exatamente isso que ela é. Dois arquivos que parecem idênticos na tela podem ser construídos de forma completamente diferente por baixo. Veja como saber qual tipo você tem, e o que fazer com o que resiste a ser copiado.
Dois tipos diferentes de página de PDF
Um PDF pode guardar uma página de duas formas bem diferentes. Em um PDF baseado em texto, cada letra é um objeto de caractere com um valor Unicode, uma fonte e uma posição, do mesmo jeito que uma página web guarda texto: um visualizador consegue selecioná-lo, pesquisá-lo, e um leitor de tela consegue ler em voz alta. Em um PDF baseado em imagem, a página é uma única imagem plana, geralmente produzida por um scanner, um fax, ou uma etapa de 'imprimir como PDF' aplicada a uma foto de um documento. As letras parecem iguais aos seus olhos, mas para o formato do arquivo não há nenhum caractere embaixo, só pixels.

Um jeito rápido de saber qual você tem
Pressione Ctrl+F ou Cmd+F e pesquise uma palavra que você consegue ver claramente na página. Se a busca encontrar e destacar, a página tem uma camada de texto real. Se a busca não encontrar nada em nenhum lugar do documento, a página é uma imagem, não importa quão nítida ou quanto pareça um documento digitado. Arrastar o mouse para selecionar uma linha dá a mesma resposta: um destaque contra uma simples seleção retangular.
Reconstruindo o texto com OCR
O reconhecimento óptico de caracteres (OCR) lê os pixels de uma página baseada em imagem e compara as formas com um modelo treinado de letras para um determinado idioma, depois reconstrói uma camada de texto com os caracteres reconhecidos posicionados onde apareceram. Uma ferramenta como o OCR faz isso inteiramente no navegador: nada é enviado, e o resultado é um arquivo de texto simples que você pode pesquisar, copiar ou editar. A precisão depende da origem: uma digitalização limpa, reta e de alta resolução em um idioma bem suportado reconhece de forma confiável, enquanto uma página torta, borrada, de baixo contraste ou manuscrita produz mais erros, às vezes um caractere errado ou uma palavra mal lida.

Quando o arquivo já tem texto mas a extração parece errada
Se o seu PDF realmente tem uma camada de texto real mas uma ferramenta como PDF para texto produz texto em uma ordem estranha, com colunas misturadas ou espaçamento colapsado, isso é um problema diferente, sem relação: os objetos de texto existem, mas a ordem de leitura deles na página não foi armazenada do jeito que um script naturalmente espera. Isso é uma peculiaridade de layout para arrumar depois da extração, não um sinal de que o texto está faltando, e não precisa de OCR para corrigir.
Ferramentas neste artigo
- OCR · imagem/PDF para textoExtraia texto de imagens digitalizadas ou PDFs inteiramente no seu navegador, roda offline, sem upload.
- PDF para textoExtraia o conteúdo de texto de um PDF e baixe como arquivo .txt, sem upload.
- OCR de PDF · torná-lo pesquisávelTransforme um PDF digitalizado em um PDF pesquisável e selecionável, totalmente no seu navegador, sem upload.
Perguntas frequentes
Meu PDF parece um documento digitado normal mas ainda assim não consigo selecionar nenhum texto. Por quê?
É bem provável que seja uma página digitalizada ou fotografada salva como PDF, ou um documento achatado em imagem de propósito. Visualmente pode ser indistinguível de um PDF baseado em texto; a diferença só aparece quando você tenta pesquisar ou selecionar. Passá-lo pelo OCR reconstrói uma camada de texto real e selecionável a partir dos pixels.
O OCR funciona igualmente bem em todos os idiomas?
Não. A precisão depende de existir um modelo treinado para aquele idioma e alfabeto, e da qualidade da digitalização. Idiomas bem suportados em uma digitalização limpa e reta reconhecem de forma confiável; letra manuscrita, imagens de baixa resolução, ou idiomas com menos dados de treinamento produzem mais erros. O resultado do OCR é sempre uma transcrição de melhor esforço, que vale a pena revisar rapidamente antes de confiar nela.