Como o OCR · imagem/PDF para texto funciona
O OCR converte uma imagem digitalizada ou PDF baseado em imagem em texto que você pode copiar, pesquisar e editar, usando o tesseract.js executando inteiramente dentro do seu navegador. Você escolhe o idioma do documento no seletor, o modelo de idioma relevante é baixado para o seu navegador uma vez, e todo o reconhecimento subsequente executa offline a partir desse modelo em cache. Seus arquivos digitalizados nunca são transmitidos a nenhum servidor durante a conversão.
A precisão do reconhecimento depende fortemente da qualidade da digitalização. Digitalizações limpas e de alto contraste a 200 DPI ou mais, com ruído de fundo mínimo e alinhamento reto da página, produzem os melhores resultados. JPEGs borrados, de baixa resolução ou muito comprimidos, páginas com colunas ou layouts complexos e texto manuscrito reduzem a precisão. A ferramenta produz um bloco de texto simples; para saída estruturada como tabelas preservadas ou layout de múltiplas colunas, processamento posterior é necessário. Executar a ferramenta PDF Deskew em digitalizações inclinadas antes do OCR tipicamente melhora as taxas de reconhecimento.