OCR PDF
Gjenkjenn tekst i skannede dokumenter og bilder, rett i nettleseren din.
Last opp
Velg filen din eller dra og slipp den.
Juster
Velg innstillingene dine — alt skjer i nettleseren din.
Last ned
Lagre den ferdige filen umiddelbart. Ingen vannmerker.
En skannet PDF er egentlig bare en bunke fotografier. Du kan verken søke i den, kopiere et avsnitt fra den eller lime inn et referansenummer ut av den. OCR-verktøyet til PDFora leser teksten inne i sidebildene ved hjelp av Tesseract, den samme åpne kildekode-motoren som brukes i seriøse dokumentsystemer, og gir deg den gjenkjente teksten som en ren .txt-fil du kan søke i, redigere og gjenbruke.
Dette er det som skiller denne OCR-en fra andre: den kjører i sin helhet inne i nettleseren din. Nesten alle OCR-tjenester på nett laster skanningen din opp til en server for behandling. Vår gjør ikke det. Gjenkjenningen foregår på din egen enhet, så et skannet pass, en signert leiekontrakt eller en side med prøvesvar blir aldri sendt noe sted. For slike dokumenter er ikke det en hyggelig detalj, det er hele poenget.
Verktøyet gjenkjenner foreløpig engelsk, hindi, spansk og fransk, og du velger språk før du kjører skanningen. Det er gratis, uten registrering, uten vannmerker og uten sidekvote. Hvor raskt gjenkjenningen går avhenger av enheten din, siden det er din prosessor som gjør selve jobben, men en vanlig side tar bare noen sekunder på en moderne laptop.
Slik kjører du OCR på en PDF på nett
- Åpne OCR PDF-verktøyet på PDFora i en moderne nettleser.
- Dra den skannede PDF-en inn i slippsonen, eller klikk for å velge den fra enheten din.
- Velg språket i dokumentet: engelsk, hindi, spansk eller fransk. Riktig språk forbedrer nøyaktigheten dramatisk.
- Klikk Gjenkjenn tekst og la Tesseract behandle hver side lokalt i nettleseren.
- Følg med på fremdriften etter hvert som sidene blir ferdige; lengre dokumenter tar litt mer tid.
- Last ned den uthentede teksten som en .txt-fil, og søk, rediger eller kopier fritt fra den.
When to use this tool
- Hente ut teksten fra en skannet rettsavgjørelse på 60 sider, slik at du kan søke etter en bestemt bestemmelse i stedet for å lese hver side.
- Trekke ut sitater fra fotograferte lærebokssider til en oppgave, uten å skrive dem av for hånd.
- Digitalisere en perm med gamle papirfakturaer slik at beløp og fakturanummer blir søkbare data.
- Gjøre et skannet rundskriv på hindi om til redigerbar tekst for oversettelse eller oppsummering.
- Redde teksten i et dokument der bare en utskrift har overlevd, ved å skanne den og kjøre OCR.
- Gjøre møtenotater og trykte rapporter siterbare i e-post ved å løfte ut teksten i stedet for å ta skjermbilder.
Tips for the best results
- Gi den den reneste skanningen du har. 300 DPI, godt lys og mørk tekst på lys bakgrunn gir langt bedre gjenkjenning enn et dunkelt mobilbilde.
- Rett opp skanningen først. Skjeve sider forvirrer tegngjenkjenningen, så kjør et skjevt dokument gjennom oppretting-verktøyet til PDFora før OCR.
- La språkinnstillingen stemme med dokumentet. Kjører du et spansk brev gjennom den engelske modellen, blir resultatet kaudervelsk, og omvendt.
- Regn med tregere kjøringer på mobil og eldre laptoper. Motoren bruker prosessoren i enheten din, så en skanning på 100 sider er en jobb for en stasjonær maskin, ikke et fem år gammelt nettbrett.
- Korrekturles tallene. OCR er svært god, men ikke feilfri, og sifre i kontonummer eller summer fortjener et manuelt blikk før du stoler på dem.
Ofte stilte spørsmål
Blir det skannede dokumentet mitt lastet opp for behandling?
Nei, og det er sjeldent blant OCR-verktøy på nett. Tesseract-motoren kjører inne i nettleseren din, så hver side gjenkjennes på din egen enhet. Ingenting sendes til en server på noe tidspunkt, noe som gjør det trygt for ID-dokumenter, kontrakter og journaler.
Hva får jeg ut?
Verktøyet henter ut den gjenkjente teksten og gir deg den som en nedlastbar .txt-fil. Derfra kan du søke i den, lime den inn i et dokument, eller mate den videre inn i enhver arbeidsflyt som trenger ren tekst.
Hvilke språk støttes?
Engelsk, hindi, spansk og fransk er tilgjengelige nå. Velg språket som passer dokumentet ditt før du kjører gjenkjenningen, for motoren laster inn en språkspesifikk modell, og nøyaktigheten avhenger av at du treffer riktig.
Hvor nøyaktig er tekstgjenkjenningen?
På en ren, godt belyst skanning av trykt tekst er nøyaktigheten som regel svært høy. Kvaliteten faller med uskarpe bilder, uvanlige skrifttyper, håndskrift eller kraftig skjevhet. Bedre inndata er det klart viktigste grepet, så skann på nytt eller rett opp en dårlig side før du klandrer motoren.
Hvorfor går OCR tregere på min enhet enn på kollegaens?
Fordi behandlingen er lokal, følger hastigheten maskinvaren din. En nyere laptop tygger seg gjennom sidene på sekunder hver, mens en eldre mobil bruker merkbart lengre tid. Baksiden av den medaljen er at den lokale behandlingen gir fullstendig personvern.
Er det en grense på sider eller filer, og koster det noe?
Ingen kostnad, ingen konto, ingen vannmerker og ingen sidekvote. Du kan kjøre OCR på et helt arkiv med skanninger om du vil. Den eneste praktiske begrensningen er tid, siden lange dokumenter tar lengre tid å behandle på din egen maskin.