PDFora
Pricing सभी टूल
👁️

OCR PDF

स्कैन किए दस्तावेज़ों और इमेज में मौजूद टेक्स्ट को पहचानिए, वो भी सीधे अपने ब्राउज़र में।

🔒 आपकी फ़ाइलें आपके ब्राउज़र में ही प्रोसेस होती हैं और कभी अपलोड नहीं होतीं।
1

अपलोड करें

अपनी फ़ाइल चुनें या खींचकर छोड़ें।

2

सेट करें

अपने विकल्प चुनें — सब कुछ आपके ब्राउज़र में होता है।

3

डाउनलोड करें

तैयार फ़ाइल तुरंत सेव करें। कोई वॉटरमार्क नहीं।

स्कैन की गई PDF दरअसल तस्वीरों का ढेर भर होती है। न आप उसमें कुछ खोज सकते हैं, न कोई पैराग्राफ़ कॉपी कर सकते हैं, न उसमें से कोई रेफ़रेंस नंबर चिपका सकते हैं। PDFora का OCR टूल उन पेज-इमेज के अंदर छिपे टेक्स्ट को Tesseract की मदद से पढ़ता है — वही ओपन-सोर्स इंजन जिस पर गंभीर दस्तावेज़ प्रणालियाँ भरोसा करती हैं — और पहचाना हुआ टेक्स्ट आपको एक साफ़ .txt फ़ाइल के रूप में देता है, जिसे आप खोज सकते हैं, एडिट कर सकते हैं और दोबारा इस्तेमाल कर सकते हैं।

इस OCR को अलग बनाने वाली बात यह है: यह पूरी तरह आपके ब्राउज़र के अंदर चलता है। लगभग हर ऑनलाइन OCR सेवा आपका स्कैन प्रोसेसिंग के लिए किसी सर्वर पर अपलोड करती है। हमारा नहीं करता। पहचान का काम आपके अपने डिवाइस पर होता है, इसलिए स्कैन किया पासपोर्ट, साइन किया लीज़, या मेडिकल रिपोर्ट का पन्ना कभी कहीं भेजा ही नहीं जाता। ऐसे दस्तावेज़ों के लिए यह कोई सजावटी सुविधा नहीं, यही तो पूरा मक़सद है।

टूल फ़िलहाल अंग्रेज़ी, हिंदी, स्पेनिश और फ़्रेंच पहचानता है, और स्कैन चलाने से पहले आप भाषा चुनते हैं। यह मुफ़्त है, न साइनअप, न वॉटरमार्क, न पेज कोटा। पहचान की रफ़्तार आपके डिवाइस पर निर्भर करती है, क्योंकि असली काम आपका ही प्रोसेसर कर रहा है, लेकिन आधुनिक लैपटॉप पर एक सामान्य पेज कुछ ही सेकंड लेता है।

ऑनलाइन PDF का OCR कैसे करें

  1. किसी आधुनिक ब्राउज़र में PDFora का OCR PDF टूल खोलिए।
  2. अपनी स्कैन की हुई PDF ड्रॉप ज़ोन पर खींचकर छोड़िए, या क्लिक करके अपने डिवाइस से चुन लीजिए।
  3. दस्तावेज़ की भाषा चुनिए: अंग्रेज़ी, हिंदी, स्पेनिश या फ़्रेंच। सही भाषा से सटीकता ज़बरदस्त तरीके से सुधरती है।
  4. Recognize Text पर क्लिक कीजिए और Tesseract को हर पेज आपके ब्राउज़र में लोकल रूप से प्रोसेस करने दीजिए।
  5. पेज पूरे होते जाएँ, प्रगति देखते रहिए; लंबे दस्तावेज़ थोड़ा ज़्यादा समय लेते हैं।
  6. निकाला हुआ टेक्स्ट .txt फ़ाइल के रूप में डाउनलोड कीजिए और उसमें बेझिझक खोजिए, एडिट कीजिए या कॉपी कीजिए।

When to use this tool

  • 60 पेज के स्कैन किए अदालती फ़ैसले से टेक्स्ट निकालना, ताकि हर पेज पढ़ने के बजाय आप उसमें कोई ख़ास धारा खोज सकें।
  • शोध पत्र के लिए पाठ्यपुस्तक के फ़ोटो खींचे गए पन्नों से उद्धरण निकालना, बिना हाथ से दोबारा टाइप किए।
  • पुराने कागज़ी बिलों का फ़ोल्डर डिजिटल करना, ताकि रकम और बिल नंबर खोजे जा सकने वाले रिकॉर्ड बन जाएँ।
  • स्कैन किए हिंदी सरकारी परिपत्र को एडिट होने लायक टेक्स्ट में बदलना, अनुवाद या सारांश के लिए।
  • ऐसे दस्तावेज़ का टेक्स्ट वापस पाना जिसका सिर्फ़ प्रिंटआउट बचा हो — उसे स्कैन करके OCR चलाकर।
  • मीटिंग के हैंडआउट और छपी रिपोर्ट को ईमेल में उद्धृत करने लायक बनाना, स्क्रीनशॉट लेने के बजाय उनका टेक्स्ट उठाकर।

Tips for the best results

  • इसे अपना सबसे साफ़ स्कैन दीजिए। 300 DPI, अच्छी रोशनी, और हल्के बैकग्राउंड पर गहरा टेक्स्ट — ये किसी मद्धिम फ़ोन फ़ोटो से कहीं बेहतर पहचान देते हैं।
  • पहले स्कैन सीधा कीजिए। टेढ़े पेज अक्षर पहचान को उलझा देते हैं, इसलिए तिरछे दस्तावेज़ को OCR से पहले PDFora के deskew टूल से गुज़ार दीजिए।
  • भाषा सेटिंग को दस्तावेज़ से मिलाइए। स्पेनिश चिट्ठी को अंग्रेज़ी मॉडल से चलाएँगे तो नतीजा बिगड़ा हुआ आएगा, और इसका उल्टा भी सच है।
  • फ़ोन और पुराने लैपटॉप पर धीमी रफ़्तार की उम्मीद रखिए। इंजन आपके डिवाइस का प्रोसेसर इस्तेमाल करता है, इसलिए 100 पेज का स्कैन डेस्कटॉप का काम है, पाँच साल पुराने टैबलेट का नहीं।
  • अंकों को दोबारा जाँचिए। OCR बहुत अच्छा है, पर परफ़ेक्ट नहीं, और खाता संख्या या कुल रकम के अंक भरोसा करने से पहले एक नज़र के हक़दार हैं।

अक्सर पूछे जाने वाले सवाल

क्या प्रोसेसिंग के लिए मेरा स्कैन किया दस्तावेज़ अपलोड होता है?

नहीं, और ऑनलाइन OCR टूल्स में यह दुर्लभ बात है। Tesseract इंजन आपके ब्राउज़र के अंदर चलता है, इसलिए हर पेज आपके अपने डिवाइस पर पहचाना जाता है। किसी भी मोड़ पर सर्वर को कुछ नहीं भेजा जाता, जिससे यह ID, कॉन्ट्रैक्ट और मेडिकल रिकॉर्ड के लिए सुरक्षित बनता है।

मुझे आउटपुट में क्या मिलता है?

टूल पहचाना हुआ टेक्स्ट निकालकर आपको डाउनलोड होने लायक .txt फ़ाइल के रूप में देता है। वहाँ से आप उसमें खोज सकते हैं, किसी दस्तावेज़ में चिपका सकते हैं, या किसी भी ऐसी प्रक्रिया में डाल सकते हैं जिसे सादा टेक्स्ट चाहिए।

कौन-कौन सी भाषाएँ समर्थित हैं?

अभी अंग्रेज़ी, हिंदी, स्पेनिश और फ़्रेंच उपलब्ध हैं। पहचान चलाने से पहले वही भाषा चुनिए जो आपके दस्तावेज़ से मेल खाती हो, क्योंकि इंजन भाषा-विशेष मॉडल लोड करता है और सटीकता सही चुनाव पर टिकी होती है।

टेक्स्ट पहचान कितनी सटीक होती है?

छपे हुए टेक्स्ट के साफ़, अच्छी रोशनी वाले स्कैन पर सटीकता आमतौर पर बहुत ऊँची रहती है। धुँधली फ़ोटो, अजीब फ़ॉन्ट, हाथ की लिखाई या ज़्यादा तिरछेपन से क्वालिटी गिरती है। सबसे बड़ा फ़र्क बेहतर इनपुट से पड़ता है, इसलिए खराब पेज के लिए इंजन को दोष देने से पहले उसे दोबारा स्कैन या deskew कीजिए।

मेरे डिवाइस पर OCR मेरे सहकर्मी के मुक़ाबले धीमा क्यों है?

क्योंकि प्रोसेसिंग लोकल है, रफ़्तार आपके हार्डवेयर के साथ चलती है। नया लैपटॉप हर पेज कुछ सेकंड में निपटा देता है, जबकि पुराना फ़ोन साफ़ तौर पर ज़्यादा समय लेता है। इसी लोकल प्रोसेसिंग का फ़ायदा है पूरी निजता।

क्या पेज या फ़ाइलों की कोई सीमा है, और क्या इसकी कोई कीमत है?

न कीमत, न अकाउंट, न वॉटरमार्क, और न पेज कोटा। चाहें तो स्कैनों का पूरा आर्काइव OCR कर डालिए। एकमात्र व्यावहारिक अड़चन समय है, क्योंकि लंबे दस्तावेज़ों को आपकी अपनी मशीन पर प्रोसेस होने में ज़्यादा वक़्त लगता है।