PDFora
Pricing 所有工具
👁️

OCR PDF

直接在瀏覽器中辨識掃描文件與影像中的文字。

🔒 你的檔案在瀏覽器中本機處理,絕不會上傳。
1

上傳

選擇檔案或直接拖放。

2

設定

選擇你的選項 — 一切都在你的瀏覽器中完成。

3

下載

立即儲存完成的檔案。沒有浮水印。

掃描版 PDF 其實只是一疊照片。你無法搜尋它、無法從裡面複製一段文字,也無法把一組編號貼出來。PDFora 的 OCR 工具使用 Tesseract——正式文件處理流程中廣受信賴的開源引擎——讀取頁面影像中的文字,並把辨識結果交給你一份乾淨的 .txt 檔,可搜尋、可編輯、可再利用。

這套 OCR 的特別之處在於:它完全在你的瀏覽器內執行。幾乎所有線上 OCR 服務都會把掃描檔上傳到伺服器處理,我們不會。辨識是在你自己的裝置上完成的,所以掃描的護照、簽好的租約,或一頁醫療檢驗報告,都不會被傳送到任何地方。對這類文件而言,這不是加分項,而是全部的重點。

工具目前可辨識英文、印地語、西班牙文與法文,執行前請先選好語言。免費、免註冊、無浮水印,也沒有頁數配額。辨識速度取決於你的裝置,因為實際運算是由你的處理器負責,但在現代筆電上,一般一頁只需要幾秒鐘。

如何線上對 PDF 做 OCR

  1. 在新版瀏覽器中開啟 PDFora 的 OCR PDF 工具。
  2. 把掃描版 PDF 拖進上傳區,或點一下從裝置中選取。
  3. 選擇文件語言:英文、印地語、西班牙文或法文。選對語言能大幅提升準確度。
  4. 點「辨識文字」,讓 Tesseract 在你的瀏覽器裡逐頁在本機處理。
  5. 觀察頁面完成的進度;文件越長,需要的時間越多。
  6. 把擷取出的文字下載為 .txt 檔,之後就能自由搜尋、編輯或複製。

When to use this tool

  • 從 60 頁的掃描版法院判決書中把文字抽出來,直接搜尋特定條款,不必逐頁翻閱。
  • 從拍下來的教科書頁面中擷取引文寫進研究論文,不用一個字一個字重打。
  • 把一整疊舊的紙本發票數位化,讓金額與發票號碼變成可搜尋的紀錄。
  • 把掃描的印地語政府公文轉成可編輯文字,方便翻譯或摘要。
  • 只剩紙本列印稿的文件,掃描後跑 OCR,把內容救回來。
  • 把會議講義與紙本報告的文字擷取出來,直接引用在email中,不必截圖。

Tips for the best results

  • 餵給它你手上最乾淨的掃描檔。300 DPI、光線充足、淺底深字的效果,遠勝過昏暗的手機照片。
  • 先把掃描檔轉正。歪斜的頁面會干擾字元辨識,所以有傾斜的文件請先用 PDFora 的校正傾斜工具處理,再做 OCR。
  • 語言設定要與文件相符。用英文模型跑西班牙文信件會得到亂七八糟的結果,反之亦然。
  • 手機與較舊的筆電會比較慢。引擎使用你裝置的處理器,所以 100 頁的掃描檔應該交給桌機,而不是五年前的平板。
  • 數字要校對。OCR 很強但並非完美,帳號與金額中的數字在你信賴它之前,值得用眼睛再看一次。

常見問題

我的掃描文件會被上傳處理嗎?

不會,而這在線上 OCR 工具中相當少見。Tesseract 引擎在你的瀏覽器內執行,每一頁都在你自己的裝置上辨識,全程不會有任何資料送到伺服器,因此拿來處理證件、合約與病歷都很安全。

輸出的成果是什麼?

工具會擷取辨識出的文字,並提供一個可下載的 .txt 檔。之後你可以搜尋它、貼進文件裡,或送進任何需要純文字的後續流程。

支援哪些語言?

目前提供英文、印地語、西班牙文與法文。執行辨識前請選擇與文件相符的語言,因為引擎會載入該語言專屬的模型,準確度取決於是否選對。

文字辨識的準確度如何?

對於乾淨、光線良好的印刷文字掃描檔,準確度通常非常高。若遇上模糊照片、特殊字體、手寫或嚴重歪斜,品質就會下降。輸入品質是影響最大的因素,所以品質差的頁面請先重掃或校正傾斜,再來怪引擎。

為什麼 OCR 在我的裝置上比同事的慢?

因為處理是在本機進行,速度取決於你的硬體。較新的筆電每頁只要幾秒,較舊的手機就明顯慢得多。本機處理的好處,就是完全的隱私。

頁數或檔案數有限制嗎?要收費嗎?

不收費、免帳號、無浮水印,也沒有頁數配額。想把整批掃描檔全部做 OCR 也沒問題。唯一實際的限制是時間,因為長文件在你自己的機器上處理需要較久。