Cómo funciona OCR · imagen/PDF a texto
OCR convierte una imagen escaneada o un PDF basado en imágenes en texto que puedes copiar, buscar y editar, usando tesseract.js ejecutándose completamente dentro de tu navegador. Eliges el idioma del documento en el selector, el modelo de idioma correspondiente se descarga a tu navegador una vez, y todo el reconocimiento posterior se ejecuta sin conexión desde ese modelo en caché. Tus archivos escaneados nunca se transmiten a ningún servidor durante la conversión.
La precisión del reconocimiento depende fuertemente de la calidad del escaneo. Los escaneos limpios y de alto contraste a 200 DPI o más, con mínimo ruido de fondo y alineación de página recta, producen los mejores resultados. Los JPEG borrosos, de baja resolución o muy comprimidos, las páginas con columnas o diseños complejos, y el texto manuscrito reducen la precisión. La herramienta produce un bloque de texto simple; para una salida estructurada como tablas conservadas o diseño de varias columnas, se necesita postprocesamiento. Ejecutar la herramienta PDF Deskew en escaneos torcidos antes del OCR generalmente mejora las tasas de reconocimiento.