OCR
OCR (Optical Character Recognition) je technológia, ktorá rozpozná text na obrázku alebo skenovanom dokumente a prevedie ho na editovateľný a prehľadávateľný text, s ktorým môže ďalej pracovať softvér.
Ako to funguje
OCR nájde na obrázku alebo v skene tvary, ktoré vyzerajú ako písmená a čísla, a prevedie ich na skutočný text. Pri spracovaní dokumentov sa OCR väčšinou kombinuje s jazykovým modelom: OCR text prečíta, model mu porozumie a vytiahne z neho konkrétne polia — dodávateľa, sumu, dátum splatnosti, variabilný symbol. Samotný OCR text bez tohto ďalšieho kroku je len digitálna kópia dokumentu, nevie povedať, ktoré číslo je suma a ktoré IČO.
Príklad z firemnej praxe
Faktúra príde ako naskenovaný PDF alebo fotka z mobilu. OCR z nej vytiahne text, model rozpozná, ktorá časť je suma, dodávateľ a splatnosť, a údaje sa doplnia do účtovného systému bez ručného prepisovania. Rovnaký princíp sa dá použiť aj pri dodacích listoch alebo objednávkach zaslaných ako obrázok, nie ako štruktúrovaný súbor.
Kedy áno a kedy nie
OCR má zmysel pri dokumentoch, ktoré prichádzajú ako obrázok alebo sken a inak by ich musel niekto prepisovať ručne. Ak dokumenty prichádzajú už ako štruktúrovaný súbor (napríklad ISDOC alebo XML faktúra), OCR netreba — dáta sa dajú prečítať priamo, presnejšie a rýchlejšie. Presnosť OCR pri zlej kvalite skenu, rukou písanom texte alebo nezvyčajnom formáte klesá, preto sa pri finančných dokumentoch oplatí mať kontrolný krok pred tým, než sa údaj použije.
Dobre nastavené spracovanie preto väčšinou nespolieha len na OCR a jeden model, ale porovnáva vytiahnuté údaje s tým, čo už firma o dodávateľovi alebo objednávke vie — nezvyčajná suma alebo nový bankový účet je dôvod na kontrolu, nie na automatické schválenie.