PDFora
Pricing Összes eszköz
👁️

OCR PDF

Ismerd fel a szkennelt dokumentumok és képek szövegét, közvetlenül a böngésződben.

🔒 A fájljaidat helyben, a böngésződben dolgozzuk fel, és soha nem töltjük fel.
1

Feltöltés

Válaszd ki vagy húzd be a fájlodat.

2

Beállítás

Válaszd ki a beállításaidat — minden a böngésződben történik.

3

Letöltés

Mentsd el az elkészült fájlt azonnal. Vízjel nélkül.

Egy szkennelt PDF valójában csak fényképek halmaza. Nem tudsz keresni benne, nem tudsz kimásolni belőle egy bekezdést, és nem tudsz kiemelni belőle egy hivatkozási számot. A PDFora OCR eszköze a Tesseract segítségével olvassa ki a szöveget ezekből az oldalképekből — ugyanazzal a nyílt forráskódú motorral, amelyre komoly dokumentumfeldolgozó rendszerek is építenek —, és letisztult .txt fájlként adja vissza a felismert szöveget, amelyben kereshetsz, amelyet szerkeszthetsz és újrahasznosíthatsz.

Ez az OCR egy dologban különbözik a többitől: teljes egészében a böngésződben fut. Szinte minden online OCR szolgáltatás feltölti a beolvasásodat egy szerverre a feldolgozáshoz. A miénk nem. A felismerés a saját eszközödön történik, így egy beszkennelt útlevél, egy aláírt bérleti szerződés vagy egy orvosi leletlap soha nem kerül át sehová. Az ilyen dokumentumoknál ez nem szépségtapasz, hanem maga a lényeg.

Az eszköz jelenleg angol, hindi, spanyol és francia nyelvet ismer fel, és a nyelvet a beolvasás indítása előtt választod ki. Ingyenes, regisztráció nélkül, vízjel nélkül és oldalkeret nélkül. A felismerés sebessége az eszközödtől függ, hiszen a tényleges munkát a te processzorod végzi, de egy átlagos oldal egy modern laptopon mindössze néhány másodperc.

Így futtathatsz OCR-t egy PDF-en online

  1. Nyisd meg a PDF OCR eszközt a PDFora oldalán, egy modern böngészőben.
  2. Húzd a beszkennelt PDF-et a behúzási területre, vagy kattintással válaszd ki az eszközödről.
  3. Válaszd ki a dokumentum nyelvét: angol, hindi, spanyol vagy francia. A megfelelő nyelv drámaian javítja a pontosságot.
  4. Kattints a szövegfelismerésre, és hagyd, hogy a Tesseract helyben, a böngésződben dolgozza fel az oldalakat.
  5. Kövesd a folyamatjelzőt, ahogy az oldalak elkészülnek; a hosszabb dokumentumok valamivel több időt vesznek igénybe.
  6. Töltsd le a kinyert szöveget .txt fájlként, és keress benne, szerkeszd vagy másolj belőle szabadon.

When to use this tool

  • Egy 60 oldalas beszkennelt bírósági ítélet szövegének kinyerése, hogy rá tudj keresni egy konkrét kitételre ahelyett, hogy minden oldalt végigolvasnál.
  • Idézetek kiemelése lefotózott tankönyvoldalakról egy kutatási dolgozathoz, kézi begépelés nélkül.
  • Egy mappányi régi papírszámla digitalizálása, hogy az összegek és a számlaszámok kereshető adatokká váljanak.
  • Egy beszkennelt hindi nyelvű hivatali körlevél szerkeszthető szöveggé alakítása fordításhoz vagy összefoglaláshoz.
  • Olyan dokumentum szövegének visszanyerése, amelyből csak egy kinyomtatott példány maradt fenn: beolvasod, és lefuttatod rajta az OCR-t.
  • Az értekezleti kiosztmányok és nyomtatott jelentések idézhetővé tétele e-mailekben: a szöveget emeled ki, nem képernyőképet készítesz róluk.

Tips for the best results

  • A lehető legtisztább beolvasást add neki. A 300 DPI, a jó megvilágítás és a világos háttéren sötét szöveg sokkal jobb felismerést eredményez, mint egy homályos telefonos fotó.
  • Előbb egyenesítsd ki a beolvasást. A ferde oldalak megzavarják a karakterfelismerést, ezért a megdőlt dokumentumokat futtasd át a PDFora ferdítéskorrekciós eszközén az OCR előtt.
  • A nyelvi beállítás illeszkedjen a dokumentumhoz. Ha egy spanyol levelet az angol modellel futtatsz, torz eredményt kapsz — és fordítva is így van.
  • Telefonon és régebbi laptopokon számíts lassabb futásra. A motor a te eszközöd processzorát használja, ezért egy 100 oldalas beolvasás asztali gépnek való feladat, nem egy ötéves táblagépnek.
  • A számokat nézd át. Az OCR nagyon jó, de nem tökéletes, és a bankszámlaszámok vagy végösszegek számjegyei megérdemelnek egy kézi ellenőrzést, mielőtt rájuk hagyatkoznál.

Gyakran ismételt kérdések

Feltöltődik a beszkennelt dokumentumom a feldolgozáshoz?

Nem, és ez ritkaság az online OCR eszközök között. A Tesseract motor a böngésződön belül fut, így minden oldal a saját eszközödön kerül felismerésre. Semmi nem megy szerverre a folyamat egyetlen pontján sem, ezért igazolványokhoz, szerződésekhez és orvosi iratokhoz is biztonságos.

Mit kapok eredményként?

Az eszköz kinyeri a felismert szöveget, és letölthető .txt fájlként adja át. Innentől kereshetsz benne, beillesztheted egy dokumentumba, vagy betáplálhatod bármilyen más munkafolyamatba, amelynek egyszerű szövegre van szüksége.

Mely nyelvek támogatottak?

Jelenleg az angol, a hindi, a spanyol és a francia érhető el. A felismerés indítása előtt válaszd ki a dokumentumodnak megfelelő nyelvet, mert a motor nyelvspecifikus modellt tölt be, és a pontosság azon múlik, hogy jól választasz-e.

Mennyire pontos a szövegfelismerés?

Nyomtatott szöveg tiszta, jól megvilágított beolvasásánál a pontosság jellemzően nagyon magas. A minőség romlik elmosódott fotóknál, szokatlan betűtípusoknál, kézírásnál vagy erős ferdeségnél. A jobb bemenet a legnagyobb hatású tényező, ezért egy rossz oldalt inkább olvass be újra vagy egyenesíts ki, mielőtt a motort hibáztatnád.

Miért lassabb nálam az OCR, mint a kollégám gépén?

Mivel a feldolgozás helyben zajlik, a sebesség a hardveredet követi. Egy friss laptop másodpercek alatt végez oldalanként, egy régebbi telefon viszont érezhetően tovább dolgozik. A helyi feldolgozás előnye cserébe a teljes adatvédelem.

Van korlát az oldalak vagy fájlok számára, és kerül ez valamibe?

Nincs díj, nincs fiók, nincs vízjel és nincs oldalkeret. Ha akarod, egy egész beolvasott archívumon lefuttathatod az OCR-t. Az egyetlen gyakorlati korlát az idő, hiszen a hosszú dokumentumok feldolgozása a saját gépeden tovább tart.