Статия
Защо не можете да копирате текст от някои PDF файлове
Опитайте да селектирате ред в един PDF и думите се маркират нормално, готови за копиране. Опитайте същото движение в друг PDF и нищо не се случва, или курсорът захваща цялата страница като снимка, защото точно това е тя. Два файла, изглеждащи идентични на екрана, могат да бъдат изградени напълно различно отдолу. Ето как да разберете кой вид имате, и какво да направите с този, който отказва да се копира.
Два различни вида PDF страница
PDF може да съхранява страница по два много различни начина. В текстово базиран PDF всяка буква е символен обект с Unicode стойност, шрифт и позиция, по същия начин, по който уеб страница съхранява текст: четец може да я селектира, търси, и четец за екрана може да я прочете на глас. В базиран на изображение PDF, страницата е една плоска картина, често произведена от скенер, факс, или стъпка „печат в PDF“, приложена върху снимка на документ. Буквите изглеждат еднакво за очите ви, но за файловия формат няма символ отдолу, само пиксели.

Бърз начин да разберете кой вид имате
Натиснете Ctrl+F или Cmd+F и потърсете дума, която ясно виждате на страницата. Ако търсенето я намери и маркира, страницата има истински текстов слой. Ако търсенето не намери нищо никъде в документа, страницата е изображение, независимо колко рязка изглежда или колко прилича на напечатан документ. Влаченето на мишката, за да селектирате ред, дава същия отговор: маркиране срещу обикновена правоъгълна селекция.
Възстановяване на текста с OCR
Оптичното разпознаване на символи (OCR) чете пикселите на базирана на изображение страница и съпоставя формите спрямо обучен модел на букви за даден език, после изгражда наново текстов слой с разпознатите символи, позиционирани там, където са се появили. Инструмент като OCR прави това изцяло в браузъра: нищо не се качва, а резултатът е обикновен текстов файл, който можете да търсите, копирате или редактирате. Точността зависи от източника: чист, прав, високорезолюционен скан на добре поддържан език разпознава надеждно, докато изкривена, размазана, с нисък контраст или ръкописна страница произвежда повече грешки, понякога грешен символ или неправилно прочетена дума.

Когато файлът вече има текст, но извличането изглежда грешно
Ако вашият PDF наистина има истински текстов слой, но инструмент като PDF към текст произвежда текст в странен ред, с обединени колони или свит интервал, това е различен, несвързан проблем: текстовите обекти съществуват, но редът им на четене на страницата не е бил съхранен по начина, който скрипт естествено очаква. Това е особеност на оформлението за изчистване след извличането, не знак, че текстът липсва, и не се нуждае от OCR, за да се поправи.
Инструменти от тази статия
- OCR · изображение/PDF към текстИзвличайте текст от сканирани изображения или PDF файлове изцяло в браузъра си, работи офлайн, без качване.
- PDF към текстИзвлечи текстовото съдържание от PDF и го изтегли като .txt файл, без качване.
- PDF OCR · направи го търсимПревърнете сканиран PDF в търсим и селектируем PDF изцяло в браузъра, без качване.
Често задавани въпроси
Моят PDF изглежда като нормален напечатан документ, но все още не мога да селектирам никакъв текст. Защо?
Най-вероятно е сканирана или фотографирана страница, запазена като PDF, или документ, нарочно сплескан в изображение. Визуално може да бъде неразличим от текстово базиран PDF; разликата се показва само когато опитате да го търсите или селектирате. Пускането му през OCR изгражда наново истински, селектируем текстов слой от пикселите.
Работи ли OCR еднакво добре на всеки език?
Не. Точността зависи от това дали съществува обучен модел за онзи език и писменост, и от качеството на скана. Добре поддържани езици на чист, прав скан разпознават надеждно; ръкописен текст, изображения с ниска резолюция, или езици с по-малко обучаващи данни произвеждат повече грешки. Резултатът от OCR винаги е транскрипция с най-добро усилие, заслужаваща бърза проверка, преди да разчитате на нея.