OCR PDF
รู้จำข้อความในเอกสารสแกนและรูปภาพได้ในเบราว์เซอร์ของคุณโดยตรง
อัปโหลด
เลือกหรือลากแล้ววางไฟล์ของคุณ
ปรับแต่ง
เลือกตัวเลือกของคุณ — ทุกอย่างเกิดขึ้นในเบราว์เซอร์ของคุณ
ดาวน์โหลด
บันทึกไฟล์ที่เสร็จแล้วได้ทันที ไม่มีลายน้ำ
ไฟล์ PDF ที่มาจากการสแกนก็คือกองภาพถ่ายดี ๆ นี่เอง คุณค้นหาข้อความในนั้นไม่ได้ คัดลอกย่อหน้าออกมาไม่ได้ และดึงเลขอ้างอิงออกมาวางก็ไม่ได้ เครื่องมือ OCR ของ PDFora จะอ่านข้อความที่อยู่ในภาพหน้าเหล่านั้นด้วย Tesseract ซึ่งเป็นเอนจินโอเพนซอร์สตัวเดียวกับที่ระบบจัดการเอกสารระดับจริงจังไว้วางใจ แล้วส่งข้อความที่รู้จำได้กลับมาให้คุณเป็นไฟล์ .txt ที่สะอาด พร้อมให้ค้นหา แก้ไข และนำไปใช้ต่อ
สิ่งที่ทำให้ OCR ตัวนี้ต่างออกไปคือ มันทำงานภายในเบราว์เซอร์ของคุณทั้งหมด บริการ OCR ออนไลน์เกือบทุกเจ้าจะอัปโหลดไฟล์สแกนของคุณขึ้นเซิร์ฟเวอร์เพื่อประมวลผล แต่ของเราไม่ทำ การรู้จำตัวอักษรเกิดขึ้นบนอุปกรณ์ของคุณเอง หนังสือเดินทางที่สแกนไว้ สัญญาเช่าที่เซ็นแล้ว หรือหน้าผลตรวจทางการแพทย์ จึงไม่เคยถูกส่งไปที่ไหนเลย สำหรับเอกสารแบบนี้ นั่นไม่ใช่แค่ความสะดวก แต่คือหัวใจทั้งหมด
ขณะนี้เครื่องมือรองรับการรู้จำภาษาอังกฤษ ฮินดี สเปน และฝรั่งเศส โดยคุณเลือกภาษาก่อนเริ่มสแกน ใช้ฟรี ไม่ต้องสมัครสมาชิก ไม่มีลายน้ำ และไม่มีโควตาจำนวนหน้า ความเร็วในการรู้จำขึ้นอยู่กับอุปกรณ์ของคุณ เพราะหน่วยประมวลผลของคุณเป็นผู้ทำงานจริง แต่หน้าทั่ว ๆ ไปใช้เวลาเพียงไม่กี่วินาทีบนแล็ปท็อปรุ่นใหม่
วิธีทำ OCR กับไฟล์ PDF ออนไลน์
- เปิดเครื่องมือ OCR PDF บน PDFora ด้วยเบราว์เซอร์รุ่นใหม่
- ลากไฟล์ PDF ที่สแกนมาวางในพื้นที่รับไฟล์ หรือคลิกเพื่อเลือกไฟล์จากอุปกรณ์ของคุณ
- เลือกภาษาของเอกสาร ได้แก่ อังกฤษ ฮินดี สเปน หรือฝรั่งเศส การเลือกภาษาให้ถูกช่วยเพิ่มความแม่นยำได้อย่างมาก
- กดปุ่มรู้จำข้อความ แล้วปล่อยให้ Tesseract ประมวลผลทีละหน้าภายในเบราว์เซอร์ของคุณ
- ดูความคืบหน้าไปเรื่อย ๆ ขณะที่แต่ละหน้าเสร็จ เอกสารที่ยาวกว่าย่อมใช้เวลานานขึ้นเล็กน้อย
- ดาวน์โหลดข้อความที่ดึงออกมาเป็นไฟล์ .txt แล้วค้นหา แก้ไข หรือคัดลอกได้อย่างอิสระ
When to use this tool
- ดึงข้อความจากคำพิพากษาที่สแกนมา 60 หน้า เพื่อค้นหาข้อความในมาตราที่ต้องการ แทนการนั่งอ่านทีละหน้า
- ดึงข้อความอ้างอิงจากหน้าตำราที่ถ่ายรูปไว้มาใส่ในงานวิจัย โดยไม่ต้องพิมพ์ใหม่ด้วยมือ
- แปลงแฟ้มใบแจ้งหนี้กระดาษเก่า ๆ ให้เป็นข้อมูลดิจิทัล เพื่อให้ยอดเงินและเลขที่ใบแจ้งหนี้กลายเป็นข้อมูลที่ค้นหาได้
- แปลงหนังสือเวียนราชการภาษาฮินดีที่สแกนมาให้เป็นข้อความที่แก้ไขได้ เพื่อนำไปแปลหรือสรุปความ
- กู้เนื้อความของเอกสารที่เหลืออยู่เพียงฉบับพิมพ์ ด้วยการสแกนแล้วนำมาผ่าน OCR
- ทำให้เอกสารประกอบการประชุมและรายงานที่พิมพ์ออกมาสามารถยกไปอ้างอิงในอีเมลได้ ด้วยการดึงข้อความออกมาแทนการจับภาพหน้าจอ
Tips for the best results
- ป้อนไฟล์สแกนที่สะอาดที่สุดเท่าที่มี ความละเอียด 300 DPI แสงดี และตัวอักษรเข้มบนพื้นสว่าง จะให้ผลการรู้จำที่ดีกว่าภาพถ่ายมือถือมืด ๆ มาก
- จัดภาพให้ตรงก่อน หน้ากระดาษที่เบี้ยวทำให้การรู้จำตัวอักษรสับสน ลองนำเอกสารที่เอียงไปผ่านเครื่องมือแก้ความเอียงของ PDFora ก่อนทำ OCR
- ตั้งค่าภาษาให้ตรงกับเอกสาร การนำจดหมายภาษาสเปนไปผ่านโมเดลภาษาอังกฤษจะได้ผลลัพธ์ที่มั่วไปหมด และในทางกลับกันก็เช่นกัน
- บนโทรศัพท์และแล็ปท็อปรุ่นเก่าจะทำงานช้ากว่าเป็นปกติ เพราะเอนจินใช้หน่วยประมวลผลของอุปกรณ์คุณ ไฟล์สแกน 100 หน้าจึงเป็นงานของเครื่องเดสก์ท็อป ไม่ใช่แท็บเล็ตอายุห้าปี
- ตรวจทานตัวเลขเสมอ OCR เก่งมากแต่ไม่สมบูรณ์แบบ ตัวเลขในหมายเลขบัญชีหรือยอดรวมสมควรได้รับการตรวจด้วยตาสักครั้งก่อนนำไปใช้จริง
คำถามที่พบบ่อย
เอกสารที่ฉันสแกนถูกอัปโหลดไปประมวลผลไหม
ไม่ และนี่เป็นเรื่องที่หาได้ยากในเครื่องมือ OCR ออนไลน์ เอนจิน Tesseract ทำงานภายในเบราว์เซอร์ของคุณ ทุกหน้าจึงถูกรู้จำบนอุปกรณ์ของคุณเอง ไม่มีอะไรถูกส่งไปยังเซิร์ฟเวอร์ในขั้นตอนใดเลย จึงปลอดภัยสำหรับเอกสารแสดงตน สัญญา และเวชระเบียน
ผลลัพธ์ที่ได้คืออะไร
เครื่องมือจะดึงข้อความที่รู้จำได้ออกมาและส่งให้คุณเป็นไฟล์ .txt ที่ดาวน์โหลดได้ จากนั้นคุณจะค้นหา วางลงในเอกสาร หรือป้อนต่อเข้าสู่กระบวนการทำงานอื่นที่ต้องการข้อความธรรมดาก็ได้
รองรับภาษาอะไรบ้าง
ตอนนี้มีภาษาอังกฤษ ฮินดี สเปน และฝรั่งเศส ให้เลือกภาษาที่ตรงกับเอกสารของคุณก่อนเริ่มรู้จำ เพราะเอนจินจะโหลดโมเดลเฉพาะภาษานั้น และความแม่นยำขึ้นอยู่กับการเลือกให้ถูกต้อง
การรู้จำข้อความแม่นยำแค่ไหน
กับไฟล์สแกนที่สะอาดและมีแสงดีของตัวหนังสือที่พิมพ์มา ความแม่นยำมักสูงมาก แต่คุณภาพจะลดลงเมื่อภาพเบลอ ใช้ฟอนต์แปลก ๆ เป็นลายมือ หรือเอียงมาก คุณภาพของไฟล์ต้นทางคือปัจจัยสำคัญที่สุด ดังนั้นควรสแกนใหม่หรือแก้ความเอียงก่อนจะไปโทษตัวเอนจิน
ทำไม OCR บนเครื่องฉันช้ากว่าของเพื่อนร่วมงาน
เพราะการประมวลผลเกิดขึ้นบนเครื่อง ความเร็วจึงขึ้นอยู่กับฮาร์ดแวร์ของคุณ แล็ปท็อปรุ่นใหม่ใช้เวลาไม่กี่วินาทีต่อหน้า ขณะที่โทรศัพท์รุ่นเก่าจะช้ากว่าอย่างเห็นได้ชัด ข้อดีของการประมวลผลบนเครื่องคือความเป็นส่วนตัวที่สมบูรณ์แบบ
มีการจำกัดจำนวนหน้าหรือไฟล์ไหม แล้วมีค่าใช้จ่ายหรือเปล่า
ไม่มีค่าใช้จ่าย ไม่ต้องมีบัญชี ไม่มีลายน้ำ และไม่มีโควตาจำนวนหน้า คุณจะทำ OCR กับคลังไฟล์สแกนทั้งคลังก็ยังได้ ข้อจำกัดเดียวที่มีจริงคือเวลา เพราะเอกสารยาว ๆ ใช้เวลาประมวลผลนานขึ้นบนเครื่องของคุณเอง