Artikel
Waarom PDF's zo lastig te bewerken zijn
Een PDF openen en verwachten dat je een zin kunt veranderen zoals in een tekstverwerker is een veelvoorkomende bron van frustratie. Een Word-document slaat alinea's, stijlen en herstroomregels op; een PDF slaat een afgewerkte pagina op. Dit is wat er echt in een PDF zit, waarom dat echte tekstbewerking lastig maakt, en wat onze tools daaraan wel en niet kunnen doen.
Een PDF beschrijft een pagina, geen alinea
Het Portable Document Format, gestandaardiseerd als ISO 32000, is ontworpen zodat een pagina er op elk apparaat en elke printer identiek uitziet: het slaat een inhoudsstroom op van laagniveau-tekeninstructies, plaats dit glyph op dit x,y-coördinaat, in plaats van alinea's herstroombare tekst. Het bestandsformaat van een tekstverwerker houdt tekst bij als een stroom tekens met stijlen en lay-outregels; een PDF houdt de afgewerkte lay-out zelf bij. Dat is precies waarom hij overal identiek weergeeft, en precies waarom een zin verplaatsen geen simpele tekstbewerking is.

Waarom een zin niet zomaar verschuift
In een herstroombaar document duwt een langere zin de rest van de alinea automatisch naar beneden. Een PDF heeft geen zo'n regel: elke tekstregel is een apart gepositioneerd object, dus een woord invoegen betekent elk daaropvolgend glyph herberekenen en herpositioneren, op die regel en vaak op elke regel eronder, om overlappende tekst te vermijden. Software die je een PDF laat bewerken als een document, reconstrueert stiekem deze stroom achter de schermen, wat waarom de resultaten spatiëring, lettertypen of regelafbrekingen kunnen verschuiven op manieren die een echte tekstverwerker nooit zou doen.
Wat onze PDF-editor daadwerkelijk doet
Onze PDF-editor voegt tekstvakken, afbeeldingen, markeringen en witte overdekkingsvlakken toe boven op de bestaande pagina, gepositioneerd waar je ze plaatst; hij raakt de onderliggende oorspronkelijke inhoudsstroom niet aan en stroomt hem niet opnieuw. Dat dekt de gangbare echte gevallen: een leeg vak op een formulier invullen, een stempel of notitie toevoegen, een regel afdekken voor het printen. Het verandert een PDF niet terug in een bewerkbare alinea zoals een tekstverwerker zou doen, omdat dat zou vereisen de structuur van het document te herbouwen, niet alleen erover heen te tekenen.

Als je echt de tekst nodig hebt, niet de lay-out
Is het doel de bewoording te hergebruiken, kopieer haar dan uit in plaats van de pagina ter plekke te bewerken: onze PDF-naar-tekst-tool extraheert de onderliggende tekenobjecten, of voert OCR uit op een gescande pagina die er geen heeft, naar platte tekst die je in elke editor kunt plakken en helemaal opnieuw kunt vormgeven. Dat omzeilt het herstroomprobleem volledig, omdat je met de woorden werkt, niet met de vaste pagina waarop ze getekend stonden.
Een PDF terug omzetten in een Word-document
Een PDF omzetten in een volledig bewerkbaar, herstroombaar Word-bestand is een ander, veel moeilijker probleem: het moet alineagrenzen, stijlen en tabelstructuur afleiden uit een pagina die alleen gepositioneerde glyphs vastlegde, precies het soort zware, onvolmaakte reconstructie dat een server-side tool doet. Dat valt echt buiten het bereik van een site die uitsluitend in de browser draait en gebouwd is rond het nooit uploaden van een bestand: het is niet iets wat wij doen, en elke tool die een perfecte PDF-naar-bewerkbaar-Word-conversie claimt, doet ergens lossy giswerk.
Tools in dit artikel
Veelgestelde vragen
Kan ik de daadwerkelijke tekst van een PDF gratis bewerken zonder hem te uploaden?
Je kunt nieuwe tekst, afbeeldingen en afdekvlakken bovenop de pagina toevoegen met onze PDF-editor, volledig in je browser. De oorspronkelijke tekst ter plekke veranderen, zoals in een tekstverwerker, vereist het document opnieuw op te bouwen als een herstroombaar bestand, wat een andere en veel zwaardere bewerking is dan elementen erop leggen.
Waarom levert tekst uit een PDF kopiëren soms een verhaspelde brij op?
PDF-tekstobjecten zijn onafhankelijk gepositioneerd en hoeven niet in leesvolgorde te zijn opgeslagen. Een pagina met een kolomindeling kan bijvoorbeeld onderliggende objecten van boven naar beneden over de hele pagina geordend hebben in plaats van kolom voor kolom, dus kan een rechtstreekse kopieer-plak-actie ongerelateerde regels door elkaar husselen.
Is er een echte manier om de inhoud van een PDF in een bewerkbaar Word-bestand te krijgen?
Speciale conversiediensten proberen het door alinea's en stijlen af te leiden uit de pagina-indeling, met wisselend resultaat afhankelijk van hoe complex het oorspronkelijke document is. Die reconstructie is niet iets wat een client-side, no-upload tool lossless kan doen, wat waarom het buiten wat deze site aanbiedt blijft; de tekst extraheren met pdf-naar-tekst en die zelf herformatteren is het eerlijke alternatief.