Sådan virker OCR · billede/PDF til tekst
OCR konverterer et scannet billede eller en billedbaseret PDF til tekst, du kan kopiere, søge i og redigere, ved hjælp af tesseract.js, der kører udelukkende inde i din browser. Du vælger dokumentsproget fra vælgeren, den relevante sprogmodel downloades til din browser en gang, og al efterfølgende genkendelse kører offline fra den cache-gemte model. Dine scannede filer sendes aldrig til nogen server under konverteringen.
Genkendelses-nøjagtighed afhænger i høj grad af scanningskvaliteten. Rene, højkontrast-scanninger ved 200 DPI eller derover med minimal baggrundsstøj og ret sidejustering giver de bedste resultater. Slørede, lavopløsnings- eller stærkt komprimerede JPEGs, sider med kolonner eller komplekse layouts og handskreven tekst reducerer alle nøjagtighed. Værktøjet udsendes et plain-text-blok; til struktureret output som bevarede tabeller eller flerkolonne-layout er efterbehandling nødvendig. Køring af PDF-retningsretning på skæve scanninger for OCR forbedrer typisk genkendelsesrater.