Без качване, 100% локално, без акаунт

PDF → Извличане на текст

Извлечете целия четим текст от PDF. Изтеглете като .txt файл. Всичко остава в браузъра, нито един файл не се изпраща до сървър.

Как работи PDF към текст

PDF to Text извлича съществуващия текстов слой от PDF и го записва като обикновен .txt файл. Извличането се извършва от pdf.js в браузъра ви, четейки обектите с текстово съдържание, вградени в потоците на страниците на PDF. Документът никога не напуска устройството ви; резултатът се сглобява локално и се предлага като директно изтегляне.

Инструментът чете текстов слой, вече присъстващ в файла. Ако PDF е създаден от текстообработваща програма или инструмент за експортиране, почти сигурно има текстов слой и извличането ще работи добре. Ако PDF е сканиране на хартиен документ, страниците съдържат само данни от изображения и няма текстов слой за извличане; в такъв случай инструментът ще върне празен или непълен изход. Сканираните PDF файлове изискват оптично разпознаване на знаци (OCR), за да произведат текст - отделен процес, не извършван от инструмента. Проверете дали PDF файлът ви има избираем текст в програма за преглед, преди да използвате инструмента.

Как да използвате PDF към текст, стъпка по стъпка

  1. Заредете PDF файла в инструмента за извличане на текст.
  2. Изчакайте pdf.js да прочете текстовия слой от всички страници.
  3. Прегледайте извлечения текст.
  4. Натиснете download, за да запазите .txt файла.

Често срещани приложения

  • Извлечете текста от PDF на научна статия, за да го поставите в приложение за водене на бележки или да го подадете на инструмент за обобщаване.
  • Извлечете съдържанието от PDF фактура в електронна таблица за счетоводство без ръчно препечатване.
  • Възстановете текста от повреден или заключен PDF, при който копирането и поставянето в програмата за преглед е нарушено.
  • Конвертирайте PDF статия в обикновен текст за обработка чрез скрипт или инструмент от командния ред.

Често задавани въпроси

Защо извлеченият текст е празен или неразборен за някои PDF файлове?

Най-честата причина е, че PDF е сканиране: страниците са изображения и нямат текстов слой. Други причини включват PDF файлове, в които текстът е съхранен като контури или персонализирани кодирания на шрифтове, които pdf.js не може да преобразува в четими знаци. За сканирани документи е необходимо OCR за получаване на текст.

Извършва ли инструментът OCR на сканирани PDF файлове?

Не. Инструментът чете съществуващ текстов слой от PDF. Той не извършва оптично разпознаване на знаци. За сканирани PDF файлове използвайте инструмента OCR, който подава изображенията на страниците на локален OCR двигател в браузъра ви.

Извършва ли се извличането на текст на сървър или в браузъра ми?

В браузъра ви. pdf.js чете структурата на PDF локално, анализира обектите с текстово съдържание от потока на всяка страница и сглобява изходния файл в паметта на браузъра. PDF данните в никой момент не напускат устройството ви по време на процеса.

Ще се запазят ли форматирането и оформлението в текстовия изход?

Не. Обикновеният текст не носи информация за шрифт, размер, цвят или позиция. Изходният файл е неформатиран текст в реда на четене, определен от pdf.js. Таблиците, многоколонните оформления и специалното форматиране се изравняват. За запазване на богатото оформление, конверторите от PDF в HTML са по-подходящи.

Мога ли да извлека текст от PDF с парола?

Ако PDF има потребителска парола за отваряне, трябва да я предоставите, за да може PDF да бъде прочетен изобщо. Ограниченията за извличане на ниво собственик може също да блокират операцията. Премахнете тези ограничения с PDF Unlock, след което опитайте извличането отново.

Трябва ли да създам акаунт, за да извлека текст от PDF?

Не. Няма регистрация и няма акаунт. Пуснете файла, прегледайте извлечената визуализация и изтеглете .txt файла.

PDF в текст работи ли в мобилен браузър?

Да. pdf.js работи по същия начин в телефонен браузър, както на компютър. Копирайте или изтеглете извлечения текст директно от мобилната страница, щом извличането приключи.