OCR PDF
Taranmış belgelerdeki ve görsellerdeki metni doğrudan tarayıcınızda tanıyın.
Yükleyin
Dosyanızı seçin veya sürükleyip bırakın.
Ayarlayın
Seçeneklerinizi belirleyin — her şey tarayıcınızda gerçekleşir.
İndirin
Tamamlanan dosyayı anında kaydedin. Filigran yok.
Taranmış bir PDF aslında bir tomar fotoğraftan ibarettir. İçinde arama yapamaz, bir paragrafı kopyalayamaz, bir referans numarasını dışarı yapıştıramazsınız. PDFora'nın OCR aracı, ciddi belge süreçlerinde güvenilen açık kaynaklı motor olan Tesseract'ı kullanarak o sayfa görüntülerindeki metni okur ve tanınan metni arayabileceğiniz, düzenleyebileceğiniz ve yeniden kullanabileceğiniz temiz bir .txt dosyası olarak size verir.
Bu OCR'ı farklı kılan şu: tamamen tarayıcınızın içinde çalışır. Neredeyse her çevrimiçi OCR hizmeti taramanızı işlenmek üzere bir sunucuya yükler. Bizimki yüklemez. Tanıma kendi cihazınızda gerçekleşir, yani taranmış bir pasaport, imzalı bir kira sözleşmesi ya da tahlil sonuçlarınız hiçbir yere iletilmez. Bu tür belgeler söz konusu olduğunda bu bir incelik değil, işin ta kendisidir.
Araç şu anda İngilizce, Hintçe, İspanyolca ve Fransızcayı tanıyor; taramayı başlatmadan önce dili siz seçiyorsunuz. Ücretsizdir; kayıt yok, filigran yok, sayfa kotası yok. Asıl işi sizin işlemciniz yaptığı için tanıma hızı cihazınıza bağlıdır, ama modern bir dizüstü bilgisayarda tipik bir sayfa yalnızca birkaç saniye sürer.
Bir PDF'e çevrimiçi olarak OCR nasıl uygulanır
- PDFora'daki OCR PDF aracını modern bir tarayıcıda açın.
- Taranmış PDF'inizi bırakma alanına sürükleyin ya da tıklayıp cihazınızdan seçin.
- Belgenin dilini seçin: İngilizce, Hintçe, İspanyolca veya Fransızca. Doğru dil, isabet oranını çarpıcı biçimde artırır.
- Metni Tanı'ya tıklayın ve Tesseract'ın her sayfayı tarayıcınızda yerel olarak işlemesini bekleyin.
- Sayfalar tamamlandıkça ilerlemeyi izleyin; uzun belgeler biraz daha fazla zaman alır.
- Çıkarılan metni .txt dosyası olarak indirin ve içinde dilediğiniz gibi arayın, düzenleyin veya kopyalayın.
When to use this tool
- 60 sayfalık taranmış bir mahkeme kararının metnini çıkarıp her sayfayı okumak yerine belirli bir maddeyi arayabilmek.
- Fotoğraflanmış ders kitabı sayfalarından bir araştırma makalesi için alıntıları, elle yeniden yazmadan almak.
- Bir klasör dolusu eski kâğıt faturayı dijitalleştirip tutarların ve fatura numaralarının aranabilir kayıtlara dönüşmesini sağlamak.
- Taranmış bir Hintçe resmî genelgeyi çeviri ya da özetleme için düzenlenebilir metne çevirmek.
- Yalnızca çıktısı kalmış bir belgenin metnini, tarayıp OCR uygulayarak geri kazanmak.
- Toplantı notlarını ve basılı raporları ekran görüntüsü almak yerine metinlerini alarak e-postalarda alıntılanabilir hâle getirmek.
Tips for the best results
- Elinizdeki en temiz taramayı verin. 300 DPI, iyi aydınlatma ve açık zemin üzerinde koyu metin, loş bir telefon fotoğrafına kıyasla çok daha iyi tanıma sağlar.
- Önce taramayı düzeltin. Eğri sayfalar karakter tanımayı şaşırtır; bu yüzden yamuk bir belgeyi OCR'dan önce PDFora'nın eğrilik düzeltme aracından geçirin.
- Dil ayarını belgeyle eşleştirin. İspanyolca bir mektubu İngilizce modelden geçirmek bozuk çıktı üretir, tersi de öyle.
- Telefonlarda ve eski dizüstü bilgisayarlarda işlemin daha yavaş olacağını hesaba katın. Motor cihazınızın işlemcisini kullanır, dolayısıyla 100 sayfalık bir tarama beş yıllık bir tabletin değil bir masaüstünün işidir.
- Sayıları gözden geçirin. OCR çok başarılıdır ama kusursuz değildir; hesap numaralarındaki ya da toplamlardaki rakamlar, onlara güvenmeden önce elle bir kontrolü hak eder.
Sıkça sorulan sorular
Taranmış belgem işlenmek üzere yükleniyor mu?
Hayır ve bu, çevrimiçi OCR araçları arasında nadir bir durum. Tesseract motoru tarayıcınızın içinde çalışır, dolayısıyla her sayfa kendi cihazınızda tanınır. Hiçbir aşamada sunucuya hiçbir şey gönderilmez; bu da aracı kimlikler, sözleşmeler ve sağlık kayıtları için güvenli kılar.
Çıktı olarak ne alıyorum?
Araç tanınan metni çıkarır ve size indirilebilir bir .txt dosyası olarak verir. Oradan itibaren içinde arama yapabilir, bir belgeye yapıştırabilir ya da düz metne ihtiyaç duyan başka herhangi bir akışa besleyebilirsiniz.
Hangi diller destekleniyor?
Şu anda İngilizce, Hintçe, İspanyolca ve Fransızca mevcut. Tanımayı başlatmadan önce belgenize uyan dili seçin; çünkü motor dile özgü bir model yükler ve isabet oranı doğru seçimi yapmanıza bağlıdır.
Metin tanıma ne kadar isabetli?
Basılı metnin temiz ve iyi aydınlatılmış bir taramasında isabet oranı genellikle çok yüksektir. Bulanık fotoğraflarda, alışılmadık yazı tiplerinde, el yazısında veya ağır eğriliklerde kalite düşer. En büyük fark yaratan tek etken girdinin kalitesidir; kötü bir sayfa için motoru suçlamadan önce yeniden tarayın ya da eğriliği düzeltin.
OCR neden benim cihazımda meslektaşımınkinden yavaş çalışıyor?
İşlem yerel olduğu için hız donanımınıza bağlıdır. Yeni bir dizüstü bilgisayar sayfaları saniyeler içinde bitirirken eski bir telefon gözle görülür şekilde daha uzun sürer. Bu yerel işlemenin karşılığı ise tam gizliliktir.
Sayfa ya da dosya sınırı var mı, bir ücreti var mı?
Ücret yok, hesap yok, filigran yok ve sayfa kotası yok. İsterseniz koca bir tarama arşivine OCR uygulayabilirsiniz. Tek pratik kısıt zamandır; uzun belgeler kendi makinenizde işlenirken daha uzun sürer.