Tutorial
Tornar um PDF digitalizado pesquisável
Um PDF digitalizado parece um documento normal, mas na verdade é uma foto de uma página: Ctrl+F não encontra nada, e você não consegue selecionar ou copiar uma única palavra. A ferramenta OCR de PDF corrige isso sem mudar o que o arquivo é. Ela lê a imagem de cada página, reconhece os caracteres com um motor de OCR no próprio dispositivo, e coloca o texto reconhecido de forma invisível por cima dessa mesma imagem, então o PDF continua aparecendo e imprimindo exatamente como antes, mas agora responde a busca e seleção de texto. O arquivo nunca sai do seu dispositivo.
Passo a passo
- Abra a ferramenta OCR de PDF e solte seu PDF digitalizado. Só arquivos PDF são aceitos, e o arquivo é limitado a 80 MB; uma digitalização típica de várias páginas fica bem abaixo disso.
- Escolha o idioma do documento no menu suspenso (inglês, francês, alemão, espanhol, português ou italiano) e, se quiser, edite o nome do arquivo de saída. O padrão mantém a extensão .pdf automaticamente.
- Clique em Executar e espere cada página ser processada. Cada página é renderizada, passa pelo motor de OCR e recebe sua própria camada de texto invisível antes que a ferramenta siga para a próxima, então um documento longo demora mais que uma página só. Baixe o resultado: ele abre e imprime de forma idêntica ao original, mas Ctrl+F, seleção de texto e copiar e colar agora funcionam.
PDF pesquisável ou texto simples: do que você realmente precisa
Esta ferramenta e a ferramenta de OCR simples resolvem o mesmo problema de base, reconhecer texto em uma imagem digitalizada, mas preservam coisas diferentes. A ferramenta de OCR descarta a imagem da página e devolve um arquivo .txt simples: use-a quando você quiser colar as palavras em um editor, traduzi-las ou pesquisá-las como texto, e não se importar em preservar a aparência original do documento. A ferramenta OCR de PDF aqui mantém o PDF original exatamente como está, imagens de página e tudo, e só adiciona uma camada de texto oculta por baixo: use-a quando o documento precisar continuar sendo um PDF que você ainda pode imprimir, enviar por e-mail ou arquivar, mas também quiser conseguir pesquisar ou copiar dele. Nenhuma das duas ferramentas reconstrói o layout como texto editável com fontes e tabelas reais; as duas trabalham a partir do mesmo texto reconhecido, só embaladas de forma diferente.
Por que o resultado depende da digitalização, e onde estão os limites
A precisão do reconhecimento acompanha a qualidade da imagem de origem, do mesmo jeito que acontece com o OCR simples: uma digitalização limpa e reta em torno de 200 a 300 DPI reconhece de forma confiável, enquanto uma foto borrada, uma página torta ou sombras fortes produzem mais palavras mal reconhecidas. Se uma página saiu torta, endireite-a com a ferramenta de correção de inclinação de PDF antes de rodar o OCR, para que a etapa de reconhecimento leia o texto nivelado. A ferramenta cobre seis idiomas (inglês, francês, alemão, espanhol, português, italiano); um documento em um idioma não suportado não será reconhecido corretamente. O processamento roda página por página na aba do seu navegador, então um documento com dezenas de páginas demora visivelmente mais que uma digitalização de duas páginas, e o arquivo é limitado a 80 MB. O PDF de saída também tende a ficar com tamanho parecido ao original, já que as imagens das páginas em si não são alteradas; se você precisar de um arquivo menor depois, passe-o pelo compressor de PDF.
Como a camada de texto invisível é construída
Cada página do PDF é primeiro rasterizada em uma imagem de canvas no seu navegador, a mesma etapa de renderização que a ferramenta PDF para imagens usa. O motor de OCR (Tesseract, compilado para WebAssembly) lê essa imagem e devolve cada palavra reconhecida junto com sua caixa delimitadora, sua posição na página. Essas palavras então são desenhadas de volta em uma cópia da página original do PDF nas posições reconhecidas, mas com opacidade zero, então nada muda visualmente: a imagem da página que você vê e imprime é a mesma que foi digitalizada, sentada por cima. Os recursos de busca e seleção de texto de um leitor de PDF só olham para essa camada de texto invisível, e é por isso que o arquivo se torna pesquisável e selecionável sem parecer diferente. Tudo isso, renderização, reconhecimento e remontagem, acontece dentro da aba do seu navegador; o PDF é lido do disco local e nunca transmitido a lugar nenhum.
As ferramentas usadas neste guia
- OCR de PDF · torná-lo pesquisávelTransforme um PDF digitalizado em um PDF pesquisável e selecionável, totalmente no seu navegador, sem upload.
- OCR · imagem/PDF para textoExtraia texto de imagens digitalizadas ou PDFs inteiramente no seu navegador, roda offline, sem upload.
- Desalinhar páginas digitalizadasEndireite PDFs digitalizados ou imagens com inclinação inteiramente no seu navegador, sem upload.
- Comprimir PDFReduza o tamanho do PDF otimizando sem perdas sua estrutura interna, sem enviar arquivos.
Perguntas frequentes
O PDF pesquisável ainda vai parecer e imprimir exatamente como a digitalização original?
Sim. A ferramenta nunca modifica a imagem da página; ela só adiciona uma camada de texto invisível por baixo dela. Na tela e no papel, o resultado é visualmente idêntico à digitalização que você soltou. O que muda é que os recursos de busca e seleção de texto de um leitor agora conseguem encontrar e pegar as palavras reconhecidas, porque leem dessa camada oculta.
Por que essa ferramenta existe junto com a ferramenta de OCR simples?
Elas atendem necessidades diferentes a partir da mesma etapa de reconhecimento. A ferramenta de OCR entrega um arquivo de texto simples, que é o que você quer se pretende colar, editar ou traduzir as palavras e não precisa manter o documento como PDF. Esta ferramenta mantém o arquivo como PDF com as imagens de página originais intactas, que é o que você quer se o documento ainda precisa ser impresso, arquivado ou enviado por e-mail como está, mas você também quer conseguir pesquisar ou copiar texto dele.