PDFora
Pricing เครื่องมือทั้งหมด
👁️

OCR PDF

รู้จำข้อความในเอกสารสแกนและรูปภาพได้ในเบราว์เซอร์ของคุณโดยตรง

🔒 ไฟล์ของคุณถูกประมวลผลภายในเบราว์เซอร์ของคุณและไม่เคยถูกอัปโหลด
1

อัปโหลด

เลือกหรือลากแล้ววางไฟล์ของคุณ

2

ปรับแต่ง

เลือกตัวเลือกของคุณ — ทุกอย่างเกิดขึ้นในเบราว์เซอร์ของคุณ

3

ดาวน์โหลด

บันทึกไฟล์ที่เสร็จแล้วได้ทันที ไม่มีลายน้ำ

ไฟล์ PDF ที่มาจากการสแกนก็คือกองภาพถ่ายดี ๆ นี่เอง คุณค้นหาข้อความในนั้นไม่ได้ คัดลอกย่อหน้าออกมาไม่ได้ และดึงเลขอ้างอิงออกมาวางก็ไม่ได้ เครื่องมือ OCR ของ PDFora จะอ่านข้อความที่อยู่ในภาพหน้าเหล่านั้นด้วย Tesseract ซึ่งเป็นเอนจินโอเพนซอร์สตัวเดียวกับที่ระบบจัดการเอกสารระดับจริงจังไว้วางใจ แล้วส่งข้อความที่รู้จำได้กลับมาให้คุณเป็นไฟล์ .txt ที่สะอาด พร้อมให้ค้นหา แก้ไข และนำไปใช้ต่อ

สิ่งที่ทำให้ OCR ตัวนี้ต่างออกไปคือ มันทำงานภายในเบราว์เซอร์ของคุณทั้งหมด บริการ OCR ออนไลน์เกือบทุกเจ้าจะอัปโหลดไฟล์สแกนของคุณขึ้นเซิร์ฟเวอร์เพื่อประมวลผล แต่ของเราไม่ทำ การรู้จำตัวอักษรเกิดขึ้นบนอุปกรณ์ของคุณเอง หนังสือเดินทางที่สแกนไว้ สัญญาเช่าที่เซ็นแล้ว หรือหน้าผลตรวจทางการแพทย์ จึงไม่เคยถูกส่งไปที่ไหนเลย สำหรับเอกสารแบบนี้ นั่นไม่ใช่แค่ความสะดวก แต่คือหัวใจทั้งหมด

ขณะนี้เครื่องมือรองรับการรู้จำภาษาอังกฤษ ฮินดี สเปน และฝรั่งเศส โดยคุณเลือกภาษาก่อนเริ่มสแกน ใช้ฟรี ไม่ต้องสมัครสมาชิก ไม่มีลายน้ำ และไม่มีโควตาจำนวนหน้า ความเร็วในการรู้จำขึ้นอยู่กับอุปกรณ์ของคุณ เพราะหน่วยประมวลผลของคุณเป็นผู้ทำงานจริง แต่หน้าทั่ว ๆ ไปใช้เวลาเพียงไม่กี่วินาทีบนแล็ปท็อปรุ่นใหม่

วิธีทำ OCR กับไฟล์ PDF ออนไลน์

  1. เปิดเครื่องมือ OCR PDF บน PDFora ด้วยเบราว์เซอร์รุ่นใหม่
  2. ลากไฟล์ PDF ที่สแกนมาวางในพื้นที่รับไฟล์ หรือคลิกเพื่อเลือกไฟล์จากอุปกรณ์ของคุณ
  3. เลือกภาษาของเอกสาร ได้แก่ อังกฤษ ฮินดี สเปน หรือฝรั่งเศส การเลือกภาษาให้ถูกช่วยเพิ่มความแม่นยำได้อย่างมาก
  4. กดปุ่มรู้จำข้อความ แล้วปล่อยให้ Tesseract ประมวลผลทีละหน้าภายในเบราว์เซอร์ของคุณ
  5. ดูความคืบหน้าไปเรื่อย ๆ ขณะที่แต่ละหน้าเสร็จ เอกสารที่ยาวกว่าย่อมใช้เวลานานขึ้นเล็กน้อย
  6. ดาวน์โหลดข้อความที่ดึงออกมาเป็นไฟล์ .txt แล้วค้นหา แก้ไข หรือคัดลอกได้อย่างอิสระ

When to use this tool

  • ดึงข้อความจากคำพิพากษาที่สแกนมา 60 หน้า เพื่อค้นหาข้อความในมาตราที่ต้องการ แทนการนั่งอ่านทีละหน้า
  • ดึงข้อความอ้างอิงจากหน้าตำราที่ถ่ายรูปไว้มาใส่ในงานวิจัย โดยไม่ต้องพิมพ์ใหม่ด้วยมือ
  • แปลงแฟ้มใบแจ้งหนี้กระดาษเก่า ๆ ให้เป็นข้อมูลดิจิทัล เพื่อให้ยอดเงินและเลขที่ใบแจ้งหนี้กลายเป็นข้อมูลที่ค้นหาได้
  • แปลงหนังสือเวียนราชการภาษาฮินดีที่สแกนมาให้เป็นข้อความที่แก้ไขได้ เพื่อนำไปแปลหรือสรุปความ
  • กู้เนื้อความของเอกสารที่เหลืออยู่เพียงฉบับพิมพ์ ด้วยการสแกนแล้วนำมาผ่าน OCR
  • ทำให้เอกสารประกอบการประชุมและรายงานที่พิมพ์ออกมาสามารถยกไปอ้างอิงในอีเมลได้ ด้วยการดึงข้อความออกมาแทนการจับภาพหน้าจอ

Tips for the best results

  • ป้อนไฟล์สแกนที่สะอาดที่สุดเท่าที่มี ความละเอียด 300 DPI แสงดี และตัวอักษรเข้มบนพื้นสว่าง จะให้ผลการรู้จำที่ดีกว่าภาพถ่ายมือถือมืด ๆ มาก
  • จัดภาพให้ตรงก่อน หน้ากระดาษที่เบี้ยวทำให้การรู้จำตัวอักษรสับสน ลองนำเอกสารที่เอียงไปผ่านเครื่องมือแก้ความเอียงของ PDFora ก่อนทำ OCR
  • ตั้งค่าภาษาให้ตรงกับเอกสาร การนำจดหมายภาษาสเปนไปผ่านโมเดลภาษาอังกฤษจะได้ผลลัพธ์ที่มั่วไปหมด และในทางกลับกันก็เช่นกัน
  • บนโทรศัพท์และแล็ปท็อปรุ่นเก่าจะทำงานช้ากว่าเป็นปกติ เพราะเอนจินใช้หน่วยประมวลผลของอุปกรณ์คุณ ไฟล์สแกน 100 หน้าจึงเป็นงานของเครื่องเดสก์ท็อป ไม่ใช่แท็บเล็ตอายุห้าปี
  • ตรวจทานตัวเลขเสมอ OCR เก่งมากแต่ไม่สมบูรณ์แบบ ตัวเลขในหมายเลขบัญชีหรือยอดรวมสมควรได้รับการตรวจด้วยตาสักครั้งก่อนนำไปใช้จริง

คำถามที่พบบ่อย

เอกสารที่ฉันสแกนถูกอัปโหลดไปประมวลผลไหม

ไม่ และนี่เป็นเรื่องที่หาได้ยากในเครื่องมือ OCR ออนไลน์ เอนจิน Tesseract ทำงานภายในเบราว์เซอร์ของคุณ ทุกหน้าจึงถูกรู้จำบนอุปกรณ์ของคุณเอง ไม่มีอะไรถูกส่งไปยังเซิร์ฟเวอร์ในขั้นตอนใดเลย จึงปลอดภัยสำหรับเอกสารแสดงตน สัญญา และเวชระเบียน

ผลลัพธ์ที่ได้คืออะไร

เครื่องมือจะดึงข้อความที่รู้จำได้ออกมาและส่งให้คุณเป็นไฟล์ .txt ที่ดาวน์โหลดได้ จากนั้นคุณจะค้นหา วางลงในเอกสาร หรือป้อนต่อเข้าสู่กระบวนการทำงานอื่นที่ต้องการข้อความธรรมดาก็ได้

รองรับภาษาอะไรบ้าง

ตอนนี้มีภาษาอังกฤษ ฮินดี สเปน และฝรั่งเศส ให้เลือกภาษาที่ตรงกับเอกสารของคุณก่อนเริ่มรู้จำ เพราะเอนจินจะโหลดโมเดลเฉพาะภาษานั้น และความแม่นยำขึ้นอยู่กับการเลือกให้ถูกต้อง

การรู้จำข้อความแม่นยำแค่ไหน

กับไฟล์สแกนที่สะอาดและมีแสงดีของตัวหนังสือที่พิมพ์มา ความแม่นยำมักสูงมาก แต่คุณภาพจะลดลงเมื่อภาพเบลอ ใช้ฟอนต์แปลก ๆ เป็นลายมือ หรือเอียงมาก คุณภาพของไฟล์ต้นทางคือปัจจัยสำคัญที่สุด ดังนั้นควรสแกนใหม่หรือแก้ความเอียงก่อนจะไปโทษตัวเอนจิน

ทำไม OCR บนเครื่องฉันช้ากว่าของเพื่อนร่วมงาน

เพราะการประมวลผลเกิดขึ้นบนเครื่อง ความเร็วจึงขึ้นอยู่กับฮาร์ดแวร์ของคุณ แล็ปท็อปรุ่นใหม่ใช้เวลาไม่กี่วินาทีต่อหน้า ขณะที่โทรศัพท์รุ่นเก่าจะช้ากว่าอย่างเห็นได้ชัด ข้อดีของการประมวลผลบนเครื่องคือความเป็นส่วนตัวที่สมบูรณ์แบบ

มีการจำกัดจำนวนหน้าหรือไฟล์ไหม แล้วมีค่าใช้จ่ายหรือเปล่า

ไม่มีค่าใช้จ่าย ไม่ต้องมีบัญชี ไม่มีลายน้ำ และไม่มีโควตาจำนวนหน้า คุณจะทำ OCR กับคลังไฟล์สแกนทั้งคลังก็ยังได้ ข้อจำกัดเดียวที่มีจริงคือเวลา เพราะเอกสารยาว ๆ ใช้เวลาประมวลผลนานขึ้นบนเครื่องของคุณเอง