PDFora
Pricing Toate instrumentele
👁️

OCR PDF

Recunoaște textul din documente scanate și din imagini, direct în browserul tău.

🔒 Fișierele tale sunt procesate local, în browserul tău, și nu sunt niciodată încărcate.
1

Încarcă

Selectează fișierul sau trage-l și plasează-l.

2

Ajustează

Alege-ți opțiunile — totul se întâmplă în browserul tău.

3

Descarcă

Salvează instantaneu fișierul finalizat. Fără filigrane.

Un PDF scanat nu este altceva decât un teanc de fotografii. Nu poți căuta în el, nu poți copia un paragraf din el și nu poți extrage un număr de referință. Instrumentul OCR de la PDFora citește textul din acele imagini de pagină folosind Tesseract, același motor open-source în care au încredere fluxurile serioase de prelucrare a documentelor, și îți predă textul recunoscut sub forma unui fișier .txt curat, în care poți căuta, pe care îl poți edita și refolosi.

Iată ce face acest OCR diferit: rulează integral în browserul tău. Aproape orice serviciu OCR online îți încarcă scanarea pe un server pentru procesare. Al nostru, nu. Recunoașterea se face pe propriul tău dispozitiv, așa că un pașaport scanat, un contract de închiriere semnat sau o pagină de rezultate medicale nu este transmisă nicăieri. Pentru astfel de documente, asta nu e un moft, ci exact ideea.

Instrumentul recunoaște în prezent engleza, hindi, spaniola și franceza, iar limba se alege înainte de scanare. Este gratuit, fără înregistrare, fără filigran și fără cotă de pagini. Viteza de recunoaștere depinde de dispozitivul tău, fiindcă procesorul tău face munca propriu-zisă, dar o pagină obișnuită durează doar câteva secunde pe un laptop modern.

Cum aplici OCR pe un PDF online

  1. Deschide instrumentul OCR pentru PDF de pe PDFora într-un browser modern.
  2. Trage PDF-ul scanat în zona de încărcare sau dă clic ca să îl alegi de pe dispozitiv.
  3. Selectează limba documentului: engleză, hindi, spaniolă sau franceză. Limba potrivită îmbunătățește dramatic acuratețea.
  4. Apasă pe Recunoaște textul și lasă Tesseract să proceseze local fiecare pagină, în browserul tău.
  5. Urmărește progresul pe măsură ce paginile sunt finalizate; documentele lungi durează ceva mai mult.
  6. Descarcă textul extras sub forma unui fișier .txt și caută, editează sau copiază din el în voie.

When to use this tool

  • Scoți textul dintr-o hotărâre judecătorească scanată de 60 de pagini, ca să poți căuta o anumită clauză în loc să citești fiecare pagină.
  • Extragi citate din pagini de manual fotografiate, pentru o lucrare de cercetare, fără să le retastezi de mână.
  • Digitalizezi un dosar cu facturi vechi pe hârtie, astfel încât sumele și numerele de factură să devină evidențe în care se poate căuta.
  • Transformi o circulară oficială scanată, în limba hindi, în text editabil, pentru traducere sau rezumare.
  • Recuperezi textul unui document din care a supraviețuit doar varianta tipărită, scanând-o și aplicând OCR.
  • Faci citabile în e-mailuri materialele de ședință și rapoartele tipărite, extrăgându-le textul în loc să le fotografiezi ecranul.

Tips for the best results

  • Dă-i cea mai curată scanare pe care o ai. 300 DPI, lumină bună și text închis pe fundal deschis produc o recunoaștere mult mai bună decât o fotografie întunecată făcută cu telefonul.
  • Îndreaptă întâi scanarea. Paginile strâmbe încurcă recunoașterea caracterelor, așa că trece un document înclinat prin instrumentul de îndreptare al PDFora înainte de OCR.
  • Potrivește setarea de limbă cu documentul. Dacă treci o scrisoare în spaniolă prin modelul pentru engleză, vei obține un rezultat schilodit, și invers.
  • Așteaptă-te la rulări mai lente pe telefoane și pe laptopuri vechi. Motorul folosește procesorul dispozitivului tău, așa că o scanare de 100 de pagini este o treabă pentru un calculator de birou, nu pentru o tabletă de cinci ani.
  • Verifică cifrele. OCR-ul este foarte bun, dar nu perfect, iar cifrele din numerele de cont sau din totaluri merită o privire atentă înainte să te bazezi pe ele.

Întrebări frecvente

Documentul meu scanat este încărcat undeva pentru procesare?

Nu, iar asta este o raritate printre instrumentele OCR online. Motorul Tesseract rulează în browserul tău, așa că fiecare pagină este recunoscută pe propriul tău dispozitiv. Nimic nu este trimis pe un server în niciun moment, ceea ce face instrumentul sigur pentru acte de identitate, contracte și fișe medicale.

Ce primesc ca rezultat?

Instrumentul extrage textul recunoscut și ți-l pune la dispoziție sub forma unui fișier .txt descărcabil. De acolo poți căuta în el, îl poți lipi într-un document sau îl poți da mai departe oricărui flux de lucru care are nevoie de text simplu.

Ce limbi sunt acceptate?

Momentan sunt disponibile engleza, hindi, spaniola și franceza. Alege limba care se potrivește documentului tău înainte de recunoaștere, fiindcă motorul încarcă un model specific fiecărei limbi, iar acuratețea depinde de alegerea corectă.

Cât de exactă este recunoașterea textului?

Pe o scanare curată și bine luminată a unui text tipărit, acuratețea este de regulă foarte ridicată. Calitatea scade cu fotografiile neclare, cu fonturile neobișnuite, cu scrisul de mână sau cu o înclinare puternică. O intrare mai bună este cea mai importantă pârghie, așa că rescanează sau îndreaptă o pagină slabă înainte să dai vina pe motor.

De ce OCR-ul este mai lent pe dispozitivul meu decât pe cel al colegului?

Fiindcă procesarea este locală, viteza urmează echipamentul tău. Un laptop recent mestecă paginile în câteva secunde fiecare, în timp ce un telefon mai vechi durează simțitor mai mult. Avantajul acelei procesări locale este confidențialitatea totală.

Există o limită de pagini sau de fișiere și costă ceva?

Niciun cost, niciun cont, niciun filigran și nicio cotă de pagini. Poți aplica OCR unei arhive întregi de scanări, dacă vrei. Singura constrângere practică este timpul, fiindcă documentele lungi durează mai mult pe propriul tău calculator.