Sin subida, 100% local, sin cuenta

Artículo

Por qué no puedes copiar texto de algunos PDF

Intenta seleccionar una línea en un PDF y las palabras se resaltan con normalidad, listas para copiarse. Prueba el mismo gesto en otro PDF y no pasa nada, o el cursor agarra toda la página como si fuera una fotografía, porque exactamente eso es. Dos archivos que se ven idénticos en pantalla pueden estar construidos de forma completamente distinta por dentro. Esto es cómo distinguir cuál tienes, y qué hacer con el que se resiste a copiarse.

Dos tipos distintos de página de PDF

Un PDF puede almacenar una página de dos formas muy distintas. En un PDF basado en texto, cada letra es un objeto de carácter con un valor Unicode, una fuente y una posición, igual que una página web guarda el texto: un visor puede seleccionarlo, buscarlo, y un lector de pantalla puede leerlo en voz alta. En un PDF basado en imagen, la página es una única imagen plana, a menudo producida por un escáner, un fax, o un paso de «imprimir a PDF» aplicado a una foto de un documento. Las letras se ven igual a simple vista, pero para el formato del archivo no hay ningún carácter debajo, solo píxeles.

Comparación lado a lado: una página de PDF basada en texto con una línea resaltada y seleccionable junto a una página de PDF basada en imagen donde el mismo texto en apariencia es una única imagen plana sin selección.

Una forma rápida de saber cuál tienes

Pulsa Ctrl+F o Cmd+F y busca una palabra que veas claramente en la página. Si la búsqueda la encuentra y la resalta, la página tiene una capa de texto real. Si la búsqueda no encuentra nada en ningún sitio del documento, la página es una imagen, por muy nítida o parecida a un documento escrito a máquina que parezca. Arrastrar el ratón para seleccionar una línea da la misma respuesta: un resaltado frente a una simple selección rectangular.

Reconstruir el texto con OCR

El reconocimiento óptico de caracteres (OCR) lee los píxeles de una página basada en imagen y compara las formas con un modelo entrenado de letras para un idioma dado, y luego reconstruye una capa de texto con los caracteres reconocidos colocados donde aparecían. Una herramienta como ocr hace esto enteramente en el navegador: nada se sube, y el resultado es un archivo de texto plano que puedes buscar, copiar o editar. La precisión depende del origen: un escaneo limpio, recto y de alta resolución en un idioma bien soportado se reconoce de forma fiable, mientras que una página torcida, borrosa, de bajo contraste o manuscrita produce más errores, a veces un carácter equivocado o una palabra mal leída.

Diagrama de proceso: los píxeles de una página escaneada pasan por el reconocimiento de caracteres OCR y salen como una capa de texto reconstruida y posicionada.

Cuando el archivo ya tiene texto pero la extracción se ve mal

Si tu PDF sí tiene una capa de texto real pero una herramienta como pdf-a-texto produce texto en un orden extraño, con columnas mezcladas o espacios colapsados, ese es un problema distinto y no relacionado: los objetos de texto existen pero su orden de lectura en la página no se guardó de la forma que un script espera de forma natural. Es una rareza de diseño que limpiar después de la extracción, no una señal de que falte texto, y no necesita OCR para arreglarse.

Herramientas en este artículo

Preguntas frecuentes

Mi PDF parece un documento escrito a máquina normal pero aun así no puedo seleccionar ningún texto. ¿Por qué?

Lo más probable es que sea una página escaneada o fotografiada guardada como PDF, o un documento aplanado a imagen a propósito. Visualmente puede ser indistinguible de un PDF basado en texto; la diferencia solo aparece cuando intentas buscarlo o seleccionarlo. Pasarlo por OCR reconstruye una capa de texto real y seleccionable a partir de los píxeles.

¿El OCR funciona igual de bien en todos los idiomas?

No. La precisión depende de si existe un modelo entrenado para ese idioma y esa escritura, y de la calidad del escaneo. Los idiomas bien soportados sobre un escaneo limpio y recto se reconocen de forma fiable; la escritura a mano, las imágenes de baja resolución o los idiomas con menos datos de entrenamiento producen más errores. El resultado del OCR siempre es una transcripción de mejor esfuerzo, que conviene revisar rápidamente antes de confiar en ella.

Fuentes