Sem upload, 100% local, sem conta

Tutorial

Como extrair as imagens embutidas de um PDF

Existem duas coisas diferentes que as pessoas querem dizer ao falar em extrair imagens de um PDF, e elas exigem ferramentas distintas. Este guia trata de recuperar os arquivos de imagem originais que foram colocados dentro do documento: as fotos que um designer inseriu em um folheto, o logotipo de um relatório, as digitalizações dentro de um contrato. Isso não é a mesma coisa que transformar cada página em uma imagem. Se você quer um instantâneo de como uma página inteira aparece, incluindo seu texto e layout, use a ferramenta PDF para JPG. O extrator aqui lê os objetos raster armazenados no PDF e devolve as próprias imagens de origem, na resolução original, tudo dentro do seu navegador.

Passo a passo

  1. Abra o extrator de imagens de PDF e solte seu arquivo nele. A ferramenta lê o documento localmente e mostra quantas imagens embutidas encontrou. Nada é enviado para lugar nenhum: a análise acontece na aba do navegador, no seu próprio dispositivo.
    O extrator de imagens de PDF com um documento carregado, exibindo a contagem de imagens embutidas encontradas
  2. Deixe que ele examine os objetos de imagem embutidos. Ele percorre cada página, coleta todos os rasters que encontra e remove cópias duplicadas de máscara suave, para que você não acabe com duas versões da mesma figura. Não há configurações de página ou formato a escolher: o objetivo é devolver os originais exatamente como foram armazenados, sem recodificá-los.
  3. Baixe os resultados. Uma única imagem volta como um arquivo; várias imagens são oferecidas como downloads individuais, nomeadas e organizadas para permanecerem em ordem. Cada arquivo mantém o formato que tinha dentro do PDF, normalmente JPEG para fotos e PNG para gráficos com transparência.
    As imagens extraídas prontas para baixar, um arquivo por imagem

Imagens embutidas e páginas transformadas em figuras

Essa é a distinção que decide qual ferramenta você precisa. Uma imagem embutida é uma foto ou um gráfico que o autor colocou dentro do PDF; este extrator devolve esse arquivo tal como foi armazenado, no seu tamanho real em pixels, sem nada pintado ao redor. Renderizar uma página como figura é o oposto: o PDF para JPG desenha tudo o que há na página (texto, formas vetoriais, fundos e as imagens embutidas juntos) em um único raster plano, na resolução que você escolher. Use o extrator quando quiser os ativos de origem de volta, por exemplo para reaproveitar a foto de um produto. Use o PDF para JPG quando quiser um instantâneo fiel da página como um leitor a vê.

Por que fazer isso localmente faz diferença

As imagens escondidas em um PDF costumam ser a parte mais sensível dele: fotos de documentos digitalizados, páginas assinadas, capturas de tela internas, ilustrações privadas. Enviar o documento a um extrator on-line entrega tudo isso a um servidor que você não controla, junto com a camada de texto e quaisquer metadados. O extrator aqui abre o PDF com o PDF.js dentro do seu navegador e retira os objetos de imagem na sua máquina, de modo que o arquivo e tudo o que há nele permanecem no seu dispositivo.

Como funciona a extração de imagens de PDF

Extrair imagens de um PDF é diferente de converter uma página em uma captura de tela raster. Dentro de um arquivo PDF, as imagens são armazenadas como dicionários de fluxo /XObject separados contendo dados binários brutos (tipicamente em codificação DCTDecode/JPEG, Flate, JPX ou CCITT) ao lado de metadados sobre dimensões e espaço de cor. Uma ferramenta de extração adequada analisa esses fluxos diretamente, extraindo cada imagem sem recodificá-la. Como os bytes brutos são lidos em vez de rerenderizados, o arquivo extraído mantém a resolução exata, o perfil de cor e a qualidade presentes quando a imagem foi originalmente embutida. Nenhuma etapa de recompressão significa nenhuma perda adicional de qualidade, independentemente de quantas vezes o próprio PDF foi ressalvo.

As ferramentas usadas neste guia

Perguntas frequentes

Vou receber as imagens originais ou capturas de tela das páginas?

As imagens originais. Esta ferramenta devolve os arquivos de imagem embutidos tal como foram armazenados no PDF, na resolução nativa e no formato original. Se, em vez disso, você quiser uma imagem de cada página inteira, incluindo o texto e o layout, isso é outra tarefa: use a ferramenta PDF para JPG, que rasteriza a página inteira na resolução que você escolher.

Por que ele encontrou menos imagens do que eu esperava?

Um PDF só contém imagens embutidas onde o autor realmente colocou arquivos raster. Gráficos vetoriais, gráficos desenhados com comandos de desenho do PDF e texto não são imagens, portanto não são extraídos. A ferramenta também descarta cópias duplicadas de máscara suave que algumas exportações criam, o que pode reduzir a contagem. Se uma página é, ela mesma, uma digitalização, em geral ela contém uma única imagem de página inteira, que é o que você receberá de volta.