PDFora
Pricing Tất cả công cụ
👁️

OCR PDF

Nhận dạng văn bản trong tài liệu scan và hình ảnh, ngay trong trình duyệt của bạn.

🔒 Tệp của bạn được xử lý cục bộ trong trình duyệt và không bao giờ được tải lên.
1

Tải lên

Chọn hoặc kéo và thả tệp của bạn.

2

Điều chỉnh

Chọn các tùy chọn của bạn — mọi thứ diễn ra ngay trong trình duyệt.

3

Tải xuống

Lưu ngay tệp đã hoàn thành. Không có hình mờ.

Một file PDF scan thực chất chỉ là một chồng ảnh chụp. Bạn không tìm kiếm được trong đó, không sao chép nổi một đoạn văn, cũng chẳng dán ra được một mã số tham chiếu. Công cụ OCR của PDFora đọc phần chữ nằm bên trong những ảnh trang đó bằng Tesseract, chính bộ máy mã nguồn mở được tin dùng trong các quy trình xử lý tài liệu nghiêm túc, rồi trao cho bạn văn bản đã nhận dạng dưới dạng một file .txt sạch sẽ để tìm kiếm, chỉnh sửa và tái sử dụng.

Đây là điều làm nên khác biệt của công cụ OCR này: nó chạy hoàn toàn bên trong trình duyệt của bạn. Gần như mọi dịch vụ OCR trực tuyến đều tải bản scan của bạn lên máy chủ để xử lý. Của chúng tôi thì không. Việc nhận dạng diễn ra ngay trên thiết bị của bạn, nên một cuốn hộ chiếu đã scan, một hợp đồng thuê nhà đã ký hay một trang kết quả xét nghiệm không bao giờ được truyền đi đâu cả. Với những tài liệu như thế, đó không phải điểm cộng nhỏ nhặt, đó là toàn bộ vấn đề.

Hiện công cụ nhận dạng được tiếng Anh, tiếng Hindi, tiếng Tây Ban Nha và tiếng Pháp, và bạn chọn ngôn ngữ trước khi chạy quét. Công cụ miễn phí, không cần đăng ký, không watermark và không giới hạn số trang. Tốc độ nhận dạng phụ thuộc vào thiết bị của bạn, bởi chính bộ xử lý của bạn mới là thứ làm việc, nhưng một trang thông thường chỉ mất vài giây trên một chiếc laptop đời mới.

Cách chạy OCR cho file PDF trực tuyến

  1. Mở công cụ OCR PDF trên PDFora bằng một trình duyệt hiện đại.
  2. Kéo file PDF đã scan thả vào vùng nhận file, hoặc bấm để chọn nó từ thiết bị của bạn.
  3. Chọn ngôn ngữ của tài liệu: tiếng Anh, tiếng Hindi, tiếng Tây Ban Nha hoặc tiếng Pháp. Chọn đúng ngôn ngữ giúp độ chính xác tăng lên rõ rệt.
  4. Bấm Nhận dạng văn bản và để Tesseract xử lý từng trang ngay trong trình duyệt của bạn.
  5. Theo dõi tiến trình khi các trang lần lượt hoàn tất; tài liệu càng dài thì càng mất thêm chút thời gian.
  6. Tải văn bản đã trích xuất về dưới dạng file .txt rồi thoải mái tìm kiếm, chỉnh sửa hay sao chép từ đó.

When to use this tool

  • Rút phần chữ ra từ một bản án tòa dài 60 trang đã scan để bạn có thể tìm kiếm một điều khoản cụ thể thay vì đọc hết từng trang.
  • Trích các đoạn trích dẫn từ ảnh chụp trang giáo trình để đưa vào bài nghiên cứu, khỏi phải gõ lại bằng tay.
  • Số hóa cả thư mục hóa đơn giấy cũ để các con số tiền và số hóa đơn trở thành dữ liệu tìm kiếm được.
  • Chuyển một công văn tiếng Hindi đã scan thành văn bản chỉnh sửa được để dịch hoặc tóm tắt.
  • Khôi phục nội dung chữ của một tài liệu mà chỉ còn sót lại bản in giấy, bằng cách scan rồi chạy OCR.
  • Làm cho tài liệu phát tay trong cuộc họp và báo cáo in ra trở nên trích dẫn được trong email, bằng cách lấy chữ ra thay vì chụp màn hình.

Tips for the best results

  • Hãy đưa vào bản scan sạch nhất bạn có. Độ phân giải 300 DPI, ánh sáng tốt và chữ đậm trên nền sáng cho kết quả nhận dạng tốt hơn nhiều so với một tấm ảnh điện thoại chụp thiếu sáng.
  • Nắn thẳng bản scan trước đã. Trang bị lệch làm rối việc nhận dạng ký tự, vậy nên hãy cho tài liệu bị nghiêng đi qua công cụ nắn thẳng của PDFora trước khi chạy OCR.
  • Hãy để thiết lập ngôn ngữ khớp với tài liệu. Cho một lá thư tiếng Tây Ban Nha chạy qua mô hình tiếng Anh sẽ cho ra kết quả méo mó, và ngược lại cũng vậy.
  • Hãy chuẩn bị tinh thần là điện thoại và laptop cũ sẽ chạy chậm hơn. Bộ máy này dùng bộ xử lý của thiết bị bạn, nên một bản scan 100 trang là việc dành cho máy để bàn, chứ không phải cho chiếc máy tính bảng năm tuổi.
  • Hãy soát lại các con số. OCR rất giỏi nhưng chưa hoàn hảo, và những chữ số trong số tài khoản hay tổng tiền xứng đáng được liếc mắt kiểm tra thủ công trước khi bạn tin vào chúng.

Câu hỏi thường gặp

Tài liệu scan của tôi có bị tải lên để xử lý không?

Không, và điều này hiếm thấy trong các công cụ OCR trực tuyến. Bộ máy Tesseract chạy bên trong trình duyệt của bạn, nên mọi trang đều được nhận dạng ngay trên thiết bị của bạn. Không có gì được gửi đến máy chủ ở bất kỳ thời điểm nào, nhờ vậy công cụ an toàn cho giấy tờ tùy thân, hợp đồng và hồ sơ bệnh án.

Tôi nhận được kết quả đầu ra ở dạng gì?

Công cụ trích xuất phần văn bản đã nhận dạng và trao cho bạn dưới dạng một file .txt tải về được. Từ đó bạn có thể tìm kiếm trong đó, dán vào một tài liệu, hoặc đưa vào bất kỳ quy trình nào khác cần văn bản thuần.

Công cụ hỗ trợ những ngôn ngữ nào?

Hiện có tiếng Anh, tiếng Hindi, tiếng Tây Ban Nha và tiếng Pháp. Hãy chọn ngôn ngữ khớp với tài liệu trước khi chạy nhận dạng, bởi bộ máy sẽ nạp một mô hình riêng cho từng ngôn ngữ và độ chính xác phụ thuộc vào việc bạn chọn đúng.

Độ chính xác của việc nhận dạng văn bản ra sao?

Với một bản scan sạch, đủ sáng và là chữ in, độ chính xác thường rất cao. Chất lượng tụt xuống khi gặp ảnh mờ, phông chữ lạ, chữ viết tay hoặc trang nghiêng nhiều. Đầu vào tốt hơn chính là đòn bẩy lớn nhất, nên hãy scan lại hoặc nắn thẳng một trang kém trước khi đổ lỗi cho bộ máy.

Vì sao OCR chạy trên máy tôi chậm hơn trên máy đồng nghiệp?

Vì việc xử lý diễn ra cục bộ, tốc độ bám sát phần cứng của bạn. Một chiếc laptop đời mới nhai mỗi trang chỉ trong vài giây, còn một chiếc điện thoại cũ sẽ mất lâu hơn thấy rõ. Đổi lại, việc xử lý cục bộ đó mang tới sự riêng tư trọn vẹn.

Có giới hạn số trang hay số file không, và có tốn phí gì không?

Không tốn phí, không cần tài khoản, không watermark và không giới hạn số trang. Bạn có thể chạy OCR cho cả một kho lưu trữ bản scan nếu muốn. Ràng buộc thực tế duy nhất là thời gian, bởi tài liệu dài thì mất nhiều thời gian xử lý hơn trên chính máy của bạn.