PDFora
Pricing Kaikki työkalut
👁️

OCR PDF

Tunnista teksti skannatuista asiakirjoista ja kuvista suoraan selaimessasi.

🔒 Tiedostosi käsitellään paikallisesti selaimessasi eikä niitä koskaan ladata palvelimelle.
1

Lataa

Valitse tiedosto tai vedä ja pudota se.

2

Säädä

Valitse asetuksesi — kaikki tapahtuu selaimessasi.

3

Lataa

Tallenna valmis tiedosto heti. Ei vesileimoja.

Skannattu PDF on vain pino valokuvia. Siitä ei voi hakea, siitä ei voi kopioida kappaletta eikä siitä saa liitettyä viitenumeroa. PDFora-palvelun OCR-työkalu lukee sivukuvien sisällä olevan tekstin Tesseract-moottorilla — samalla avoimen lähdekoodin moottorilla, johon luotetaan vakavasti otettavissa dokumenttiprosesseissa — ja antaa sinulle tunnistetun tekstin siistinä .txt-tiedostona, jota voit hakea, muokata ja käyttää uudelleen.

Tässä on se mikä tekee tästä OCR-ratkaisusta erilaisen: se toimii kokonaan selaimesi sisällä. Lähes jokainen verkon OCR-palvelu lataa skannauksesi palvelimelle käsiteltäväksi. Meidän ei lataa. Tunnistus tapahtuu omalla laitteellasi, joten skannattua passia, allekirjoitettua vuokrasopimusta tai laboratoriotulossivua ei koskaan lähetetä minnekään. Tällaisissa asiakirjoissa se ei ole mukava lisä vaan koko pointti.

Työkalu tunnistaa tällä hetkellä englantia, hindiä, espanjaa ja ranskaa, ja valitset kielen ennen tunnistuksen käynnistämistä. Se on ilmainen ilman rekisteröitymistä, ilman vesileimaa ja ilman sivukiintiötä. Tunnistusnopeus riippuu laitteestasi, koska varsinaisen työn tekee sinun suorittimesi, mutta tavallinen sivu vie nykyaikaisella kannettavalla vain muutaman sekunnin.

Näin teet OCR-tunnistuksen PDF-tiedostolle verkossa

  1. Avaa PDFora-palvelun OCR-työkalu nykyaikaisessa selaimessa.
  2. Vedä skannattu PDF-tiedostosi pudotusalueelle tai napsauta valitaksesi sen laitteeltasi.
  3. Valitse asiakirjan kieli: englanti, hindi, espanja tai ranska. Oikea kieli parantaa tarkkuutta dramaattisesti.
  4. Napsauta Tunnista teksti ja anna Tesseractin käsitellä jokainen sivu paikallisesti selaimessasi.
  5. Seuraa edistymistä sivujen valmistuessa; pidemmät asiakirjat vievät hieman enemmän aikaa.
  6. Lataa poimittu teksti .txt-tiedostona ja hae, muokkaa tai kopioi siitä vapaasti.

When to use this tool

  • Tekstin poimiminen 60-sivuisesta skannatusta tuomioistuimen päätöksestä, jotta voit hakea siitä tiettyä kohtaa sen sijaan että lukisit jokaisen sivun.
  • Lainausten poimiminen valokuvatuista oppikirjan sivuista tutkielmaa varten ilman käsin uudelleenkirjoittamista.
  • Kansiollisen vanhoja paperilaskuja digitointi, jotta summista ja laskunumeroista tulee haettavia tietoja.
  • Skannatun hindinkielisen viranomaiskirjeen muuntaminen muokattavaksi tekstiksi käännöstä tai tiivistämistä varten.
  • Sellaisen asiakirjan tekstin palauttaminen, josta on säilynyt vain paperituloste, skannaamalla se ja ajamalla OCR.
  • Kokousmonisteiden ja painettujen raporttien tekeminen sähköposteissa lainattaviksi poimimalla niiden teksti kuvakaappausten sijaan.

Tips for the best results

  • Syötä työkalulle puhtain saatavilla oleva skannaus. 300 DPI, hyvä valaistus ja tumma teksti vaalealla pohjalla tuottavat huomattavasti paremman tunnistuksen kuin hämärä puhelinkuva.
  • Suorista skannaus ensin. Vinot sivut hämmentävät merkkitunnistusta, joten aja kallistunut asiakirja PDFora-palvelun oikaisutyökalun läpi ennen OCR-käsittelyä.
  • Sovita kieliasetus asiakirjaan. Espanjankielisen kirjeen ajaminen englannin mallilla tuottaa siansaksaa, ja päinvastoin.
  • Varaudu hitaampiin ajoihin puhelimilla ja vanhemmilla kannettavilla. Moottori käyttää laitteesi suoritinta, joten 100-sivuinen skannaus on työpöytäkoneen työ eikä viisi vuotta vanhan tabletin.
  • Oikolue numerot. OCR on erittäin hyvä muttei täydellinen, ja tilinumeroiden tai loppusummien numerot ansaitsevat silmäyksen ennen kuin luotat niihin.

Usein kysytyt kysymykset

Ladataanko skannattu asiakirjani jonnekin käsiteltäväksi?

Ei, ja tämä on harvinaista verkon OCR-työkalujen joukossa. Tesseract-moottori toimii selaimesi sisällä, joten jokainen sivu tunnistetaan omalla laitteellasi. Mitään ei lähetetä palvelimelle missään vaiheessa, mikä tekee siitä turvallisen henkilöllisyystodistuksille, sopimuksille ja potilastiedoille.

Mitä saan lopputuloksena?

Työkalu poimii tunnistetun tekstin ja antaa sen sinulle ladattavana .txt-tiedostona. Siitä eteenpäin voit hakea siitä, liittää sen asiakirjaan tai syöttää sen mihin tahansa muuhun työnkulkuun, joka tarvitsee pelkkää tekstiä.

Mitä kieliä tuetaan?

Englanti, hindi, espanja ja ranska ovat tällä hetkellä käytettävissä. Valitse asiakirjaasi vastaava kieli ennen tunnistuksen ajamista, sillä moottori lataa kielikohtaisen mallin ja tarkkuus riippuu oikeasta valinnasta.

Kuinka tarkkaa tekstintunnistus on?

Puhtaassa, hyvin valaistussa painetun tekstin skannauksessa tarkkuus on tyypillisesti erittäin korkea. Laatu heikkenee epäterävissä valokuvissa, epätavallisissa kirjasimissa, käsialassa ja voimakkaassa kallistumassa. Parempi syöte on ylivoimaisesti tehokkain vipu, joten skannaa tai oikaise heikko sivu ennen kuin syytät moottoria.

Miksi OCR on hitaampi minun laitteellani kuin kollegani?

Koska käsittely on paikallista, nopeus seuraa laitteistoasi. Tuore kannettava jauhaa sivun sekunneissa, kun taas vanhemmalla puhelimella se vie huomattavasti pidempään. Paikallisen käsittelyn kääntöpuolena on täydellinen yksityisyys.

Onko sivujen tai tiedostojen määrälle rajaa ja maksaako se mitään?

Ei kuluja, ei tiliä, ei vesileimaa eikä sivukiintiötä. Voit halutessasi ajaa OCR:n kokonaiselle skannausarkistolle. Ainoa käytännön rajoite on aika, sillä pitkien asiakirjojen käsittely vie omalla koneellasi pidempään.