Artículo
Mejorar la precisión del OCR: corrige la imagen antes de reconocer el texto
El OCR es tan bueno como la imagen que se le proporciona. Un escaneo torcido, de bajo contraste y con ruido produce texto ilegible sin importar la calidad del motor. Esto es lo que realmente marca la diferencia, en el orden en que debe hacerse, todo ejecutándose localmente en el navegador.
Por qué el OCR tiene dificultades con los escaneos reales
Un motor OCR como Tesseract fue entrenado con texto limpio, horizontal y de alto contraste. Segmenta una página en líneas, las líneas en palabras y las palabras en formas de caracteres, y luego compara cada forma con su modelo entrenado. Los escaneos reales rompen esas suposiciones: la página está inclinada unos pocos grados, la iluminación es desigual, la resolución es baja, y el borde de la bandeja del escáner o la página enfrentada añade ruido oscuro. Cada uno de estos problemas hace que el paso de segmentación de líneas y caracteres cometa errores, y una segmentación incorrecta se propaga en caracteres incorrectos. La solución rara vez es un motor distinto: es preparar la imagen para que las suposiciones del motor se cumplan. En la práctica, el preprocesamiento mejora la precisión más que la elección del motor OCR.

Empieza por la resolución: apunta a 300 DPI
Tesseract funciona mejor a unos 300 DPI para el texto de cuerpo normal. Por debajo de aproximadamente 200 DPI, los trazos de cada glifo se fusionan con los vecinos y la precisión cae bruscamente. Si controlas el escaneo, configura el escáner a 300 DPI antes que cualquier otra cosa, ya que es la decisión con mayor impacto individual. Si solo tienes una imagen de baja resolución, ampliarla no inventa detalles que nunca se capturaron, pero una ampliación moderada puede ayudar al motor a separar caracteres que se tocan al dar más píxeles a la segmentación. Los textos muy pequeños se benefician de 400 a 600 DPI; más allá de eso solo crece el archivo sin ninguna mejora en precisión. Cuando la fuente es un PDF, rasteriza primero cada página a una imagen en el DPI objetivo y luego ejecuta el OCR sobre esa imagen.
Corrige la orientación
Si la página está rotada 90, 180 o 270 grados, el motor lee de lado o al revés y devuelve texto sin sentido. Tesseract tiene un paso de detección de orientación y script (OSD) que puede estimar la rotación, pero no es fiable con texto disperso, formularios o páginas dominadas por imágenes. Rotar la página en posición vertical uno mismo elimina la incertidumbre. Este paso no tiene pérdidas y es instantáneo: rotar un múltiplo de 90 grados solo reasigna los píxeles existentes a nuevas posiciones, sin coste de calidad ni remuestreo. Hazlo antes de corregir la inclinación, porque ese paso asume que el texto ya está aproximadamente horizontal.
Corrección de inclinación: endereza la pequeña torsión
Incluso una inclinación de 2 a 3 grados, del tipo que resulta de introducir una página ligeramente torcida, perjudica el OCR: el paso de búsqueda de líneas horizontales divide una línea de texto en dos, o fusiona dos líneas en una. La corrección de inclinación mide el ángulo dominante de las líneas de texto (habitualmente mediante análisis de perfil de proyección o transformada de Hough) y rota la página para nivelarla. A diferencia de un giro de 90 grados, la corrección de inclinación es una pequeña rotación de ángulo arbitrario que remuestrea píxeles y añade una ligera cantidad de desenfoque. Ese intercambio casi siempre vale la pena, porque las líneas niveladas se segmentan limpiamente y la ganancia de precisión supera con creces el ligero suavizado. Corrige la inclinación después de fijar la orientación y antes de recortar.

Recorta el texto y elimina el ruido
Todo lo que no sea el texto que buscas es ruido que el motor puede leer erróneamente: el borde oscuro de la bandeja del escáner, parte de la página enfrentada, una esquina grapada, un dedo o un agujero de perforación. Recortar hasta el bloque de texto elimina esos falsos objetivos, lo que mejora la precisión y acelera el reconocimiento porque el motor tiene menos área que analizar. En un documento de varias columnas, el recorte (o ejecutar el OCR columna por columna) también evita que el motor lea en horizontal a través del margen e intercale dos columnas en una sola línea ilegible. Recorta después de corregir la inclinación, para que el contenido quede encuadrado.
Contraste, escala de grises y cómo funciona realmente la binarización
El OCR opera en última instancia sobre una imagen binaria: cada píxel se clasifica como tinta o papel. Tesseract hace esto internamente usando el método de Otsu, que elige un umbral global único a partir del histograma de la imagen. Eso funciona bien cuando la página tiene iluminación uniforme y buen contraste, y falla cuando una sombra o un fondo de color hace que una esquina sea más oscura de lo que el umbral espera. Los resultados fiables se obtienen convirtiendo a escala de grises, para que una dominante de color no confunda el umbral, y uniformando la iluminación para que toda la página quede a un lado de él. Aumentar el contraste moderadamente ayuda con el texto tenue. Lo que suele salir mal es la binarización manual forzada: si se aplica el umbral a puro blanco y negro con el valor incorrecto, se borran los trazos tenues que el propio paso del motor habría conservado. Deja que el motor binarice y dale una imagen uniforme en escala de grises como punto de partida. Sunasty ofrece escala de grises para PDF; para un ajuste fino del contraste, un editor de escritorio sigue siendo mejor, pero una iluminación uniforme en el momento del escaneo importa más que cualquier control deslizante.
Elige el idioma correcto y verifica el resultado
Tesseract carga un archivo de datos entrenado diferente por idioma y script. Ejecutar un modelo en inglés sobre texto francés o griego produce errores evitables, especialmente en caracteres acentuados o no latinos, así que selecciona el idioma que coincida con el documento. Por último, trata el resultado del OCR como un borrador, no como una respuesta definitiva: el motor no tiene forma de saber si un nombre está escrito correctamente o si un 0 no es una O. Revisa números, nombres propios y todo lo que tenga importancia legal o financiera. Para tablas y diseños de varias columnas, espera tener que corregir la estructura a mano, porque el OCR devuelve un flujo de texto reconocido, no un diseño reconstruido.
Herramientas en este artículo
- OCR · imagen/PDF a textoExtrae texto de imágenes escaneadas o PDFs completamente en tu navegador, funciona sin conexión, sin subida.
- Enderezar páginas escaneadasCorrige el ángulo de inclinación de PDFs o imágenes escaneadas completamente en tu navegador, sin subida.
- Rotar y voltear imágenesRota imágenes 90/180/270° o voltéalas horizontal y verticalmente, sin subirlas.
- Recortar imagenRecorta tus imágenes con una vista previa interactiva, arrastra y redimensiona el área de recorte. Sin subida.
- PDF a escala de grisesConvierte un PDF en color a escala de grises completamente en tu navegador, sin subida.
- Redimensionar imágenesRedimensiona y convierte tus imágenes (JPEG, PNG, WebP) sin subirlas.
- PDF a imágenesConvierte cada página del PDF a PNG o JPG directamente en tu navegador.
Preguntas frecuentes
¿Ampliar un escaneo borroso mejora el OCR?
No mucho por sí solo. Ampliar no puede recuperar detalles que el escaneo nunca capturó, así que una imagen borrosa a 100 DPI sigue siendo borrosa. Una ampliación moderada puede ayudar al motor a separar caracteres que se tocan al dar a la segmentación más píxeles, pero reescanear a 300 DPI es mucho más eficaz que cualquier ampliación.
¿Debo convertir la imagen a puro blanco y negro primero?
Normalmente no. Tesseract binariza internamente con el método de Otsu, y un umbral manual forzado con el valor incorrecto borra los trazos tenues que el motor habría conservado. Convierte a escala de grises y uniforma la iluminación, y deja que el motor elija su propio umbral.
Mi texto está de lado. ¿El OCR lo rotará automáticamente?
A veces. Tesseract tiene un paso de detección de orientación, pero no es fiable con formularios, texto disperso o páginas con muchas imágenes. Rotar la página en posición vertical 90, 180 o 270 grados no tiene pérdidas y elimina la incertidumbre, por lo que es la opción más segura.
¿Todo esto sube mi documento?
No. La rotación, la corrección de inclinación, el recorte, la conversión a escala de grises y el OCR en sí se ejecutan todos en el navegador. El OCR utiliza una versión WebAssembly de Tesseract, y los datos lingüísticos entrenados se descargan una vez y se guardan en caché. Tu archivo nunca abandona el dispositivo.