OCR PDF
直接在瀏覽器中辨識掃描文件與影像中的文字。
上傳
選擇檔案或直接拖放。
設定
選擇你的選項 — 一切都在你的瀏覽器中完成。
下載
立即儲存完成的檔案。沒有浮水印。
掃描版 PDF 其實只是一疊照片。你無法搜尋它、無法從裡面複製一段文字,也無法把一組編號貼出來。PDFora 的 OCR 工具使用 Tesseract——正式文件處理流程中廣受信賴的開源引擎——讀取頁面影像中的文字,並把辨識結果交給你一份乾淨的 .txt 檔,可搜尋、可編輯、可再利用。
這套 OCR 的特別之處在於:它完全在你的瀏覽器內執行。幾乎所有線上 OCR 服務都會把掃描檔上傳到伺服器處理,我們不會。辨識是在你自己的裝置上完成的,所以掃描的護照、簽好的租約,或一頁醫療檢驗報告,都不會被傳送到任何地方。對這類文件而言,這不是加分項,而是全部的重點。
工具目前可辨識英文、印地語、西班牙文與法文,執行前請先選好語言。免費、免註冊、無浮水印,也沒有頁數配額。辨識速度取決於你的裝置,因為實際運算是由你的處理器負責,但在現代筆電上,一般一頁只需要幾秒鐘。
如何線上對 PDF 做 OCR
- 在新版瀏覽器中開啟 PDFora 的 OCR PDF 工具。
- 把掃描版 PDF 拖進上傳區,或點一下從裝置中選取。
- 選擇文件語言:英文、印地語、西班牙文或法文。選對語言能大幅提升準確度。
- 點「辨識文字」,讓 Tesseract 在你的瀏覽器裡逐頁在本機處理。
- 觀察頁面完成的進度;文件越長,需要的時間越多。
- 把擷取出的文字下載為 .txt 檔,之後就能自由搜尋、編輯或複製。
When to use this tool
- 從 60 頁的掃描版法院判決書中把文字抽出來,直接搜尋特定條款,不必逐頁翻閱。
- 從拍下來的教科書頁面中擷取引文寫進研究論文,不用一個字一個字重打。
- 把一整疊舊的紙本發票數位化,讓金額與發票號碼變成可搜尋的紀錄。
- 把掃描的印地語政府公文轉成可編輯文字,方便翻譯或摘要。
- 只剩紙本列印稿的文件,掃描後跑 OCR,把內容救回來。
- 把會議講義與紙本報告的文字擷取出來,直接引用在email中,不必截圖。
Tips for the best results
- 餵給它你手上最乾淨的掃描檔。300 DPI、光線充足、淺底深字的效果,遠勝過昏暗的手機照片。
- 先把掃描檔轉正。歪斜的頁面會干擾字元辨識,所以有傾斜的文件請先用 PDFora 的校正傾斜工具處理,再做 OCR。
- 語言設定要與文件相符。用英文模型跑西班牙文信件會得到亂七八糟的結果,反之亦然。
- 手機與較舊的筆電會比較慢。引擎使用你裝置的處理器,所以 100 頁的掃描檔應該交給桌機,而不是五年前的平板。
- 數字要校對。OCR 很強但並非完美,帳號與金額中的數字在你信賴它之前,值得用眼睛再看一次。
常見問題
我的掃描文件會被上傳處理嗎?
不會,而這在線上 OCR 工具中相當少見。Tesseract 引擎在你的瀏覽器內執行,每一頁都在你自己的裝置上辨識,全程不會有任何資料送到伺服器,因此拿來處理證件、合約與病歷都很安全。
輸出的成果是什麼?
工具會擷取辨識出的文字,並提供一個可下載的 .txt 檔。之後你可以搜尋它、貼進文件裡,或送進任何需要純文字的後續流程。
支援哪些語言?
目前提供英文、印地語、西班牙文與法文。執行辨識前請選擇與文件相符的語言,因為引擎會載入該語言專屬的模型,準確度取決於是否選對。
文字辨識的準確度如何?
對於乾淨、光線良好的印刷文字掃描檔,準確度通常非常高。若遇上模糊照片、特殊字體、手寫或嚴重歪斜,品質就會下降。輸入品質是影響最大的因素,所以品質差的頁面請先重掃或校正傾斜,再來怪引擎。
為什麼 OCR 在我的裝置上比同事的慢?
因為處理是在本機進行,速度取決於你的硬體。較新的筆電每頁只要幾秒,較舊的手機就明顯慢得多。本機處理的好處,就是完全的隱私。
頁數或檔案數有限制嗎?要收費嗎?
不收費、免帳號、無浮水印,也沒有頁數配額。想把整批掃描檔全部做 OCR 也沒問題。唯一實際的限制是時間,因為長文件在你自己的機器上處理需要較久。