Sin subida, 100% local, sin cuenta

Tutorial

Hacer buscable un PDF escaneado

Un PDF escaneado parece un documento normal pero en realidad es una foto de una página: Ctrl+F no encuentra nada, y no puedes seleccionar ni copiar ni una sola palabra. La herramienta OCR de PDF arregla esto sin cambiar lo que es el archivo. Lee la imagen de cada página, reconoce los caracteres con un motor de OCR en el dispositivo y coloca el texto reconocido de forma invisible encima de esa misma imagen, así que el PDF sigue viéndose e imprimiéndose exactamente igual que antes pero ahora responde a la búsqueda y a la selección de texto. El archivo nunca sale de tu dispositivo.

Paso a paso

  1. Abre la herramienta OCR de PDF y suelta tu PDF escaneado. Solo se aceptan archivos PDF, y el archivo está limitado a 80 MB; un escaneo típico de varias páginas queda muy por debajo de eso.
  2. Elige el idioma del documento en el desplegable (inglés, francés, alemán, español, portugués o italiano) y, si quieres, edita el nombre del archivo de salida. Por defecto conserva la extensión .pdf automáticamente.
  3. Haz clic en Ejecutar y espera a que se procese cada página. Cada página se renderiza, pasa por el motor de OCR y recibe su propia capa de texto invisible antes de que la herramienta pase a la siguiente, así que un documento largo tarda más que uno de una sola página. Descarga el resultado: se abre e imprime idéntico al original, pero Ctrl+F, la selección de texto y copiar y pegar ahora funcionan.

PDF buscable o texto plano: cuál necesitas realmente

Esta herramienta y la herramienta de OCR normal resuelven el mismo problema de fondo, reconocer texto en una imagen escaneada, pero conservan cosas distintas. La herramienta OCR descarta la imagen de la página y te devuelve un archivo .txt plano: úsala cuando quieras pegar las palabras en un editor, traducirlas o buscarlas como texto, y no te importe conservar el aspecto original del documento. La herramienta OCR de PDF de aquí mantiene el PDF original exactamente igual, con sus imágenes de página y todo, y solo añade una capa de texto oculta debajo: úsala cuando el documento tenga que seguir siendo un PDF que puedas imprimir, enviar por correo o archivar, pero también quieras poder buscar o copiar de él. Ninguna de las dos herramientas reconstruye el diseño como texto editable con fuentes y tablas reales; ambas trabajan con el mismo texto reconocido, solo que empaquetado de forma diferente.

Por qué el resultado depende del escaneo, y dónde están los límites

La precisión del reconocimiento sigue la calidad de la imagen de origen, igual que con el OCR normal: un escaneo limpio y recto de unos 200 a 300 PPP se reconoce de forma fiable, mientras que una foto borrosa, una página torcida o sombras marcadas producen más palabras mal leídas. Si una página salió torcida, endereza con la herramienta de enderezado de PDF antes de ejecutar el OCR para que el paso de reconocimiento lea el texto nivelado. La herramienta cubre seis idiomas (inglés, francés, alemán, español, portugués, italiano); un documento en un idioma no compatible no se reconocerá correctamente. El procesamiento se hace página por página en la pestaña de tu navegador, así que un documento con decenas de páginas tarda notablemente más que un escaneo de dos páginas, y el archivo está limitado a 80 MB. El PDF de salida también suele parecerse en tamaño al original, ya que las imágenes de página en sí no se tocan; si necesitas un archivo más pequeño después, pásalo por el compresor de PDF.

Cómo se construye la capa de texto invisible

Cada página del PDF se rasteriza primero a una imagen de canvas en tu navegador, el mismo paso de renderizado que usa la herramienta PDF a imagen. El motor de OCR (Tesseract, compilado a WebAssembly) lee esa imagen y devuelve cada palabra reconocida junto con su recuadro delimitador, su posición en la página. Esas palabras se dibujan de nuevo sobre una copia de la página original del PDF en sus posiciones reconocidas, pero con opacidad cero, así que nada cambia visualmente: la imagen de página que ves e imprimes es la misma que se escaneó, encima. Las funciones de búsqueda y selección de texto de un visor de PDF solo miran esa capa de texto invisible, por eso el archivo se vuelve buscable y seleccionable sin verse distinto. Todo esto, renderizado, reconocimiento y reensamblaje, ocurre dentro de la pestaña de tu navegador; el PDF se lee del disco local y nunca se transmite a ningún sitio.

Las herramientas usadas en esta guía

Preguntas frecuentes

¿El PDF buscable seguirá viéndose e imprimiéndose exactamente igual que el escaneo original?

Sí. La herramienta nunca modifica la imagen de la página; solo añade una capa de texto invisible debajo. En pantalla y en papel, el resultado es visualmente idéntico al escaneo que soltaste. Lo que cambia es que las herramientas de búsqueda y selección de texto de un visor ahora pueden encontrar y tomar las palabras reconocidas, porque leen esa capa oculta.

¿Por qué existe esta herramienta junto a la herramienta de OCR normal?

Responden a necesidades distintas a partir del mismo paso de reconocimiento. La herramienta OCR te da un archivo de texto plano, lo que quieres si planeas pegar, editar o traducir las palabras y no necesitas conservar el documento como PDF. Esta herramienta mantiene el archivo como PDF con las imágenes de página originales intactas, lo que quieres si el documento todavía necesita imprimirse, archivarse o enviarse por correo tal cual, pero también quieres poder buscar o copiar texto de él.

Fuentes