PDFora
Pricing כל הכלים
👁️

OCR PDF

זהו טקסט במסמכים סרוקים ובתמונות, ישירות בדפדפן שלכם.

🔒 הקבצים שלכם מעובדים מקומית בדפדפן ולעולם אינם מועלים לשרת.
1

העלאה

בחרו את הקובץ שלכם או גררו ושחררו אותו.

2

התאמה

בחרו את האפשרויות שלכם — הכול קורה בתוך הדפדפן.

3

הורדה

שמרו את הקובץ המוכן מיד. ללא סימני מים.

קובץ PDF סרוק הוא בעצם ערימת צילומים. אי אפשר לחפש בו, אי אפשר להעתיק ממנו פסקה ואי אפשר לשלוף ממנו מספר אסמכתה. כלי ה‑OCR של PDFora קורא את הטקסט שבתוך תמונות העמודים בעזרת Tesseract, אותו מנוע קוד פתוח שסומכים עליו בצינורות עיבוד מסמכים רציניים, ומגיש לכם את הטקסט המזוהה כקובץ ‎.txt נקי שאפשר לחפש בו, לערוך אותו ולעשות בו שימוש חוזר.

והנה מה שעושה את ה‑OCR הזה שונה: הוא רץ כולו בתוך הדפדפן שלכם. כמעט כל שירות OCR מקוון מעלה את הסריקה שלכם לשרת לצורך עיבוד. שלנו לא. הזיהוי מתרחש על המכשיר שלכם, כך שדרכון סרוק, הסכם שכירות חתום או דף תוצאות רפואיות לעולם אינם נשלחים לשום מקום. במסמכים כאלה, זו אינה תוספת נחמדה — זה כל העניין.

הכלי מזהה כרגע אנגלית, הינדי, ספרדית וצרפתית, ואתם בוחרים את השפה לפני הרצת הסריקה. הוא חינמי, ללא הרשמה, ללא סימן מים וללא מכסת עמודים. מהירות הזיהוי תלויה במכשיר שלכם, מכיוון שהמעבד שלכם מבצע את העבודה בפועל, אבל עמוד טיפוסי לוקח רק כמה שניות במחשב נייד מודרני.

איך להריץ OCR על PDF אונליין

  1. פתחו את כלי ה‑OCR ל‑PDF של PDFora בדפדפן מודרני.
  2. גררו את קובץ ה‑PDF הסרוק אל אזור השחרור, או לחצו כדי לבחור אותו מהמכשיר שלכם.
  3. בחרו את שפת המסמך: אנגלית, הינדי, ספרדית או צרפתית. השפה הנכונה משפרת את הדיוק באופן דרמטי.
  4. לחצו על זיהוי טקסט ותנו ל‑Tesseract לעבד כל עמוד מקומית בדפדפן שלכם.
  5. עקבו אחרי ההתקדמות ככל שעמודים מסתיימים; מסמכים ארוכים לוקחים קצת יותר זמן.
  6. הורידו את הטקסט שחולץ כקובץ ‎.txt וחפשו בו, ערכו או העתיקו ממנו בחופשיות.

When to use this tool

  • שליפת הטקסט מפסק דין סרוק בן 60 עמודים, כדי שתוכלו לחפש בו סעיף מסוים במקום לקרוא כל עמוד.
  • חילוץ ציטוטים מעמודי ספר לימוד מצולמים לצורך עבודת מחקר, בלי להקליד אותם מחדש ידנית.
  • המרה דיגיטלית של תיקייה מלאה בחשבוניות נייר ישנות, כך שהסכומים ומספרי החשבוניות יהפכו לרשומות ניתנות לחיפוש.
  • המרת חוזר ממשלתי סרוק בהינדי לטקסט ניתן לעריכה לצורך תרגום או סיכום.
  • שחזור הטקסט של מסמך שממנו שרד רק תדפיס, על ידי סריקתו והרצת OCR.
  • הפיכת דפי חלוקה מישיבות ודוחות מודפסים לניתנים לציטוט במיילים, בשליפת הטקסט שלהם במקום בצילום מסך.

Tips for the best results

  • הזינו את הסריקה הנקייה ביותר שיש לכם. 300 DPI, תאורה טובה וטקסט כהה על רקע בהיר מפיקים זיהוי טוב בהרבה מצילום טלפון עמום.
  • יישרו את הסריקה קודם. עמודים עקומים מבלבלים את זיהוי התווים, אז העבירו מסמך נטוי בכלי היישור של PDFora לפני ה‑OCR.
  • התאימו את הגדרת השפה למסמך. הרצת מכתב בספרדית דרך המודל האנגלי תפיק פלט משובש, ולהפך.
  • צפו להרצות איטיות יותר בטלפונים ובמחשבים ניידים ישנים. המנוע משתמש במעבד של המכשיר שלכם, ולכן סריקה בת 100 עמודים היא משימה למחשב שולחני ולא לטאבלט בן חמש.
  • הגיהו את המספרים. ה‑OCR טוב מאוד אבל אינו מושלם, וספרות במספרי חשבון או בסכומים ראויות למבט אנושי לפני שאתם מסתמכים עליהן.

שאלות נפוצות

האם המסמך הסרוק שלי מועלה לצורך עיבוד?

לא, וזה נדיר בקרב כלי OCR מקוונים. מנוע Tesseract רץ בתוך הדפדפן שלכם, כך שכל עמוד מזוהה על המכשיר שלכם. שום דבר אינו נשלח לשרת בשום שלב, מה שהופך את הכלי לבטוח עבור תעודות זהות, חוזים ורשומות רפואיות.

מה מקבלים כפלט?

הכלי מחלץ את הטקסט המזוהה ומגיש לכם אותו כקובץ ‎.txt להורדה. משם אפשר לחפש בו, להדביק אותו למסמך, או להזין אותו לכל תהליך עבודה אחר שזקוק לטקסט פשוט.

אילו שפות נתמכות?

אנגלית, הינדי, ספרדית וצרפתית זמינות כרגע. בחרו את השפה שתואמת את המסמך שלכם לפני הרצת הזיהוי, מפני שהמנוע טוען מודל ייעודי לכל שפה והדיוק תלוי בבחירה הנכונה.

עד כמה זיהוי הטקסט מדויק?

בסריקה נקייה ומוארת היטב של טקסט מודפס, הדיוק בדרך כלל גבוה מאוד. האיכות יורדת עם צילומים מטושטשים, גופנים חריגים, כתב יד או הטיה חזקה. קלט טוב יותר הוא המנוף הגדול ביותר, אז סרקו מחדש או יישרו עמוד גרוע לפני שאתם מאשימים את המנוע.

למה ה‑OCR איטי יותר במכשיר שלי מאשר אצל עמית שלי?

מכיוון שהעיבוד מקומי, המהירות נגזרת מהחומרה שלכם. מחשב נייד עדכני לועס עמודים בשניות בודדות, בעוד שטלפון ישן לוקח משמעותית יותר זמן. הצד החיובי של העיבוד המקומי הזה הוא פרטיות מוחלטת.

יש הגבלה על עמודים או קבצים, וזה עולה כסף?

אין עלות, אין חשבון, אין סימן מים ואין מכסת עמודים. אתם יכולים להריץ OCR על ארכיון שלם של סריקות אם תרצו. האילוץ המעשי היחיד הוא זמן, מכיוון שמסמכים ארוכים לוקחים יותר לעבד על המכשיר שלכם.