OCR PDF
Rozpoznaj tekst w zeskanowanych dokumentach i obrazach, prosto w przeglądarce.
Prześlij
Wybierz plik lub przeciągnij go i upuść.
Dostosuj
Wybierz opcje — wszystko dzieje się w Twojej przeglądarce.
Pobierz
Zapisz gotowy plik od razu. Bez znaków wodnych.
Zeskanowany PDF to po prostu stos fotografii. Nie przeszukasz go, nie skopiujesz z niego akapitu, nie wklejisz numeru referencyjnego. Narzędzie OCR w PDFora odczytuje tekst ukryty w tych obrazach stron przy użyciu Tesseract, tego samego silnika open source, któremu ufają poważne systemy obiegu dokumentów, i oddaje Ci rozpoznany tekst w czystym pliku .txt, który możesz przeszukiwać, edytować i wykorzystywać dalej.
Oto, co odróżnia ten OCR od innych: działa w całości wewnątrz Twojej przeglądarki. Niemal każda internetowa usługa OCR wysyła Twój skan na serwer, żeby go tam przetworzyć. Nasza tego nie robi. Rozpoznawanie odbywa się na Twoim własnym urządzeniu, więc zeskanowany paszport, podpisana umowa najmu czy strona z wynikami badań nigdy nigdzie nie są przesyłane. Przy takich dokumentach to nie jest miły dodatek, tylko cały sens.
Narzędzie rozpoznaje obecnie język angielski, hindi, hiszpański i francuski, a język wybierasz przed uruchomieniem skanowania. Jest bezpłatne, bez rejestracji, bez znaku wodnego i bez limitu stron. Szybkość rozpoznawania zależy od Twojego urządzenia, bo faktyczną pracę wykonuje Twój procesor, ale typowa strona zajmuje na nowoczesnym laptopie zaledwie kilka sekund.
Jak wykonać OCR pliku PDF online
- Otwórz narzędzie OCR PDF w PDFora w nowoczesnej przeglądarce.
- Przeciągnij zeskanowany PDF na pole upuszczania albo kliknij, aby wybrać go z urządzenia.
- Wskaż język dokumentu: angielski, hindi, hiszpański lub francuski. Właściwy język drastycznie poprawia dokładność.
- Kliknij Rozpoznaj tekst i pozwól, by Tesseract przetworzył każdą stronę lokalnie w Twojej przeglądarce.
- Obserwuj postęp w miarę kończenia kolejnych stron; dłuższe dokumenty potrzebują nieco więcej czasu.
- Pobierz odczytany tekst jako plik .txt i swobodnie go przeszukuj, edytuj lub kopiuj.
When to use this tool
- Wydobycie tekstu z zeskanowanego, 60-stronicowego wyroku sądu, żeby wyszukać konkretny zapis zamiast czytać wszystkie strony.
- Wyciągnięcie cytatów ze sfotografowanych stron podręcznika do pracy naukowej, bez przepisywania ich ręcznie.
- Cyfryzacja folderu ze starymi papierowymi fakturami, żeby kwoty i numery faktur stały się przeszukiwalnymi danymi.
- Zamiana zeskanowanego okólnika urzędowego w języku hindi w edytowalny tekst do tłumaczenia lub streszczenia.
- Odzyskanie treści dokumentu, z którego przetrwał wyłącznie wydruk — przez zeskanowanie go i uruchomienie OCR.
- Uczynienie materiałów ze spotkań i drukowanych raportów cytowalnymi w mailach dzięki przeniesieniu ich tekstu zamiast robienia zrzutów ekranu.
Tips for the best results
- Podaj mu najczystszy skan, jaki masz. 300 DPI, dobre oświetlenie i ciemny tekst na jasnym tle dają nieporównanie lepsze rozpoznanie niż ciemnawe zdjęcie z telefonu.
- Najpierw wyprostuj skan. Przekrzywione strony mylą rozpoznawanie znaków, więc przepuść przechylony dokument przez narzędzie do prostowania w PDFora przed OCR.
- Dopasuj ustawienie języka do dokumentu. Puszczenie hiszpańskiego listu przez model angielski da poszatkowany wynik i odwrotnie.
- Na telefonach i starszych laptopach licz się z wolniejszą pracą. Silnik korzysta z procesora Twojego urządzenia, więc skan liczący 100 stron to zadanie dla komputera stacjonarnego, a nie pięcioletniego tabletu.
- Sprawdzaj liczby. OCR jest bardzo dobry, ale nie idealny, a cyfry w numerach kont czy sumach zasługują na rzut oka, zanim na nich polegniesz.
Najczęściej zadawane pytania
Czy mój zeskanowany dokument jest wysyłany do przetworzenia?
Nie, a wśród internetowych narzędzi OCR to rzadkość. Silnik Tesseract działa wewnątrz Twojej przeglądarki, więc każda strona rozpoznawana jest na Twoim własnym urządzeniu. Nic i w żadnym momencie nie trafia na serwer, co czyni narzędzie bezpiecznym dla dokumentów tożsamości, umów i dokumentacji medycznej.
Co dostaję na wyjściu?
Narzędzie wydobywa rozpoznany tekst i przekazuje go w postaci pliku .txt do pobrania. Stamtąd możesz go przeszukiwać, wkleić do dokumentu albo wpuścić w dowolny inny proces wymagający zwykłego tekstu.
Jakie języki są obsługiwane?
Obecnie dostępne są angielski, hindi, hiszpański i francuski. Przed uruchomieniem rozpoznawania wybierz język zgodny z dokumentem, ponieważ silnik ładuje model przypisany do konkretnego języka, a dokładność zależy od trafnego wyboru.
Jak dokładne jest rozpoznawanie tekstu?
Na czystym, dobrze oświetlonym skanie drukowanego tekstu dokładność jest zwykle bardzo wysoka. Spada przy rozmazanych zdjęciach, nietypowych krojach pisma, piśmie odręcznym i mocnym przekrzywieniu. Lepszy materiał wejściowy to zdecydowanie największa dźwignia, więc słabą stronę raczej przeskanuj ponownie lub wyprostuj, zamiast obwiniać silnik.
Dlaczego OCR działa u mnie wolniej niż na komputerze kolegi?
Ponieważ przetwarzanie jest lokalne, szybkość idzie w parze z Twoim sprzętem. Świeży laptop przemiela strony w kilka sekund każdą, a starszy telefon potrzebuje wyraźnie więcej czasu. Zaletą tego lokalnego przetwarzania jest pełna prywatność.
Czy jest limit stron lub plików i czy to coś kosztuje?
Zero kosztów, zero konta, zero znaku wodnego i zero limitu stron. Możesz przepuścić przez OCR całe archiwum skanów, jeśli chcesz. Jedynym praktycznym ograniczeniem jest czas, bo długie dokumenty dłużej przetwarzają się na Twojej własnej maszynie.