Slik fungerer OCR · bilde/PDF til tekst
OCR konverterer et skannet bilde eller en bildebasert PDF til tekst du kan kopiere, søke i og redigere, ved hjelp av tesseract.js som kjører helt inne i nettleseren din. Du velger dokumentspråket fra velgeren, den relevante språkmodellen lastes ned til nettleseren én gang, og all påfølgende gjenkjenning kjøres frakoblet fra den bufrede modellen. De skannede filene dine overføres aldri til noen server under konverteringen.
Gjenkjenningsnøyaktigheten avhenger sterkt av skanningskvaliteten. Rene, høykontrastskannede sider ved 200 DPI eller høyere, med minimal bakgrunnsstøy og rett sidejustering, gir de beste resultatene. Uskarpe, lavoppløselige eller sterkt komprimerte JPEG-er, sider med kolonner eller komplekse oppsett, og håndskrevet tekst reduserer alle nøyaktigheten. Verktøyet gir en ren tekstblokk; for strukturert utdata som bevarte tabeller eller flerkolonneoppsett er etterprosessering nødvendig. Å kjøre PDF Deskew-verktøyet på skjeve skannede sider før OCR forbedrer typisk gjenkjenningsratene.