OCR PDF
Rozpoznejte text v naskenovaných dokumentech a obrázcích přímo ve svém prohlížeči.
Nahrát
Vyberte soubor nebo jej přetáhněte.
Nastavit
Zvolte si možnosti — vše probíhá ve vašem prohlížeči.
Stáhnout
Hotový soubor okamžitě uložte. Žádné vodoznaky.
Naskenované PDF je vlastně jen štůsek fotografií. Nedá se v něm hledat, nezkopírujete z něj odstavec ani nevytáhnete číslo jednací. Nástroj OCR od PDFora přečte text uvnitř těchto obrazů stránek pomocí enginu Tesseract, tedy stejného open-source řešení, kterému se důvěřuje i ve vážných dokumentových systémech, a předá vám rozpoznaný text jako čistý soubor .txt, ve kterém můžete hledat, upravovat ho a dál používat.
V čem je tohle OCR jiné: běží kompletně uvnitř vašeho prohlížeče. Skoro každá online služba pro OCR nahrává váš sken kvůli zpracování na server. Ta naše ne. Rozpoznávání probíhá na vašem vlastním zařízení, takže naskenovaný pas, podepsaná nájemní smlouva nebo stránka s výsledky vyšetření se nikam neodesílá. U takových dokumentů to není příjemný bonus, ale úplný základ.
Nástroj momentálně rozpoznává angličtinu, hindštinu, španělštinu a francouzštinu a jazyk zvolíte před spuštěním. Je zdarma, bez registrace, bez vodoznaku a bez limitu na počet stránek. Rychlost rozpoznávání závisí na vašem zařízení, protože skutečnou práci odvádí váš procesor, ale běžná stránka zabere na moderním notebooku jen pár sekund.
Jak online udělat OCR na PDF
- Otevřete nástroj OCR PDF na PDFora v moderním prohlížeči.
- Přetáhněte naskenované PDF do vyznačené plochy, nebo ho vyberte kliknutím ze zařízení.
- Zvolte jazyk dokumentu: angličtinu, hindštinu, španělštinu nebo francouzštinu. Správný jazyk přesnost výrazně zlepší.
- Klikněte na Rozpoznat text a nechte Tesseract zpracovat každou stránku lokálně ve vašem prohlížeči.
- Sledujte průběh, jak se stránky dokončují; delší dokumenty potřebují o něco víc času.
- Stáhněte si získaný text jako soubor .txt a volně v něm hledejte, upravujte ho nebo z něj kopírujte.
When to use this tool
- Vytáhnout text z šedesátistránkového naskenovaného soudního rozhodnutí, abyste v něm mohli hledat konkrétní ustanovení místo čtení každé stránky.
- Získat citace z vyfocených stránek učebnice pro odbornou práci, aniž byste je museli ručně přepisovat.
- Digitalizovat složku starých papírových faktur, aby se z částek a čísel faktur staly prohledávatelné záznamy.
- Převést naskenovaný hindský úřední oběžník na editovatelný text pro překlad nebo shrnutí.
- Zachránit text dokumentu, ze kterého zbyl jen výtisk — naskenovat ho a pustit na něj OCR.
- Umožnit citování z podkladů z porady a tištěných zpráv v e-mailech tím, že z nich vytáhnete text místo snímků obrazovky.
Tips for the best results
- Použijte ten nejčistší sken, jaký máte. 300 DPI, dobré světlo a tmavý text na světlém pozadí dávají mnohem lepší rozpoznání než šerá fotka z mobilu.
- Sken nejdřív narovnejte. Nakřivo nasnímané stránky rozpoznávání znaků mate, takže nakloněný dokument před OCR prožeňte nástrojem PDFora na narovnání.
- Nastavení jazyka musí odpovídat dokumentu. Když španělský dopis proženete anglickým modelem, výstup bude zprzněný, a naopak.
- Na telefonech a starších noteboocích počítejte s pomalejším během. Engine využívá procesor vašeho zařízení, takže sto stránek je práce pro počítač, ne pro pět let starý tablet.
- Čísla si zkontrolujte. OCR je velmi dobré, ale ne dokonalé, a číslice v číslech účtů nebo v součtech si zaslouží ruční pohled, než se na ně spolehnete.
Často kladené otázky
Nahrává se můj naskenovaný dokument někam kvůli zpracování?
Ne, a to je mezi online nástroji pro OCR vzácnost. Engine Tesseract běží uvnitř vašeho prohlížeče, takže se každá stránka rozpoznává na vašem zařízení. Nic se v žádné fázi neposílá na server, díky čemuž je nástroj bezpečný pro doklady, smlouvy i zdravotní dokumentaci.
Co dostanu na výstupu?
Nástroj získá rozpoznaný text a předá vám ho jako soubor .txt ke stažení. Odtud v něm můžete hledat, vložit ho do dokumentu nebo ho poslat do jakéhokoli dalšího procesu, který potřebuje prostý text.
Které jazyky jsou podporované?
Aktuálně jsou k dispozici angličtina, hindština, španělština a francouzština. Před spuštěním rozpoznávání zvolte jazyk odpovídající vašemu dokumentu — engine načítá model pro konkrétní jazyk a přesnost na správné volbě závisí.
Jak přesné rozpoznávání textu je?
U čistého, dobře nasvíceného skenu tištěného textu bývá přesnost velmi vysoká. Kvalita klesá u rozmazaných fotek, neobvyklých písem, rukopisu nebo výrazného naklonění. Lepší vstup je zdaleka nejsilnější páka, takže špatnou stránku raději znovu naskenujte nebo narovnejte, než začnete vinit engine.
Proč je OCR na mém zařízení pomalejší než u kolegy?
Protože zpracování je lokální, rychlost kopíruje váš hardware. Novější notebook stránky spolyká po sekundách, starší telefon potřebuje znatelně déle. Výhodou lokálního zpracování je naprosté soukromí.
Je omezený počet stránek či souborů a stojí to něco?
Žádná platba, žádný účet, žádný vodoznak a žádný limit stránek. Klidně můžete přes OCR pustit celý archiv skenů. Jediným praktickým omezením je čas, protože dlouhé dokumenty se na vašem počítači zpracovávají déle.