Artículo
Por qué no puedes copiar texto de algunos PDF
Intenta seleccionar una línea en un PDF y las palabras se resaltan con normalidad, listas para copiarse. Prueba el mismo gesto en otro PDF y no pasa nada, o el cursor agarra toda la página como si fuera una fotografía, porque exactamente eso es. Dos archivos que se ven idénticos en pantalla pueden estar construidos de forma completamente distinta por dentro. Esto es cómo distinguir cuál tienes, y qué hacer con el que se resiste a copiarse.
Dos tipos distintos de página de PDF
Un PDF puede almacenar una página de dos formas muy distintas. En un PDF basado en texto, cada letra es un objeto de carácter con un valor Unicode, una fuente y una posición, igual que una página web guarda el texto: un visor puede seleccionarlo, buscarlo, y un lector de pantalla puede leerlo en voz alta. En un PDF basado en imagen, la página es una única imagen plana, a menudo producida por un escáner, un fax, o un paso de «imprimir a PDF» aplicado a una foto de un documento. Las letras se ven igual a simple vista, pero para el formato del archivo no hay ningún carácter debajo, solo píxeles.

Una forma rápida de saber cuál tienes
Pulsa Ctrl+F o Cmd+F y busca una palabra que veas claramente en la página. Si la búsqueda la encuentra y la resalta, la página tiene una capa de texto real. Si la búsqueda no encuentra nada en ningún sitio del documento, la página es una imagen, por muy nítida o parecida a un documento escrito a máquina que parezca. Arrastrar el ratón para seleccionar una línea da la misma respuesta: un resaltado frente a una simple selección rectangular.
Reconstruir el texto con OCR
El reconocimiento óptico de caracteres (OCR) lee los píxeles de una página basada en imagen y compara las formas con un modelo entrenado de letras para un idioma dado, y luego reconstruye una capa de texto con los caracteres reconocidos colocados donde aparecían. Una herramienta como ocr hace esto enteramente en el navegador: nada se sube, y el resultado es un archivo de texto plano que puedes buscar, copiar o editar. La precisión depende del origen: un escaneo limpio, recto y de alta resolución en un idioma bien soportado se reconoce de forma fiable, mientras que una página torcida, borrosa, de bajo contraste o manuscrita produce más errores, a veces un carácter equivocado o una palabra mal leída.

Cuando el archivo ya tiene texto pero la extracción se ve mal
Si tu PDF sí tiene una capa de texto real pero una herramienta como pdf-a-texto produce texto en un orden extraño, con columnas mezcladas o espacios colapsados, ese es un problema distinto y no relacionado: los objetos de texto existen pero su orden de lectura en la página no se guardó de la forma que un script espera de forma natural. Es una rareza de diseño que limpiar después de la extracción, no una señal de que falte texto, y no necesita OCR para arreglarse.
Herramientas en este artículo
- OCR · imagen/PDF a textoExtrae texto de imágenes escaneadas o PDFs completamente en tu navegador, funciona sin conexión, sin subida.
- PDF a textoExtrae el contenido de texto de un PDF y descárgalo como archivo .txt, sin subirlo.
- OCR de PDF · hazlo buscableConvierte un PDF escaneado en un PDF buscable y seleccionable, todo en tu navegador, sin subirlo.
Preguntas frecuentes
Mi PDF parece un documento escrito a máquina normal pero aun así no puedo seleccionar ningún texto. ¿Por qué?
Lo más probable es que sea una página escaneada o fotografiada guardada como PDF, o un documento aplanado a imagen a propósito. Visualmente puede ser indistinguible de un PDF basado en texto; la diferencia solo aparece cuando intentas buscarlo o seleccionarlo. Pasarlo por OCR reconstruye una capa de texto real y seleccionable a partir de los píxeles.
¿El OCR funciona igual de bien en todos los idiomas?
No. La precisión depende de si existe un modelo entrenado para ese idioma y esa escritura, y de la calidad del escaneo. Los idiomas bien soportados sobre un escaneo limpio y recto se reconocen de forma fiable; la escritura a mano, las imágenes de baja resolución o los idiomas con menos datos de entrenamiento producen más errores. El resultado del OCR siempre es una transcripción de mejor esfuerzo, que conviene revisar rápidamente antes de confiar en ella.