OCR PDF
直接在浏览器里识别扫描文档和图片中的文字。
上传
选择文件或拖放到此处。
设置
选择你的选项 —— 一切都在你的浏览器中完成。
下载
即刻保存完成的文件。无水印。
扫描版 PDF 说白了就是一叠照片。你没法搜索它,没法从里面复制一段话,也没法把某个编号粘出来。PDFora 的 OCR 工具用 Tesseract 识别这些页面图像里的文字——正是众多严肃文档流水线所信赖的那款开源引擎——并把识别结果交给你,是一份干净的 .txt 文件,可搜索、可编辑、可复用。
这款 OCR 的不同之处在于:它完全在你的浏览器里运行。几乎所有在线 OCR 服务都会把你的扫描件上传到服务器处理,我们不会。识别在你自己的设备上进行,所以护照扫描件、签好字的租约、一页体检结果,都不会被传输到任何地方。对这类文档而言,这不是锦上添花,而是全部意义所在。
工具目前支持识别英语、印地语、西班牙语和法语,运行前先选好语言即可。免费、免注册、不加水印,也不限页数。识别速度取决于你的设备,因为真正干活的是你的处理器,不过在较新的笔记本电脑上,普通一页只需几秒钟。
如何在线对 PDF 做 OCR
- 用现代浏览器打开 PDFora 的「PDF OCR」工具。
- 把扫描版 PDF 拖到上传区,或点击从设备中选择。
- 选择文档语言:英语、印地语、西班牙语或法语。选对语言能大幅提升准确率。
- 点击「识别文字」,Tesseract 会在浏览器内逐页本地处理。
- 查看页面完成进度;文档越长,耗时越久。
- 把识别出的文字下载为 .txt 文件,随意搜索、编辑或复制。
When to use this tool
- 从 60 页的扫描版判决书中提取文字,直接搜索某个条款,不必逐页翻阅。
- 从拍下的教材页面里摘取引文用于论文,不用一个字一个字重敲。
- 把一堆旧的纸质发票数字化,让金额和发票号变成可检索的记录。
- 把扫描的印地语政府通告转成可编辑文本,便于翻译或做摘要。
- 只剩打印稿的文件,扫描后跑一遍 OCR,把文字内容找回来。
- 把会议材料和纸质报告的文字提取出来,在邮件里直接引用,不必截图。
Tips for the best results
- 尽量喂给它最干净的扫描件。300 DPI、光线充足、浅底深字的稿件,识别效果远好于昏暗的手机照片。
- 先把扫描件摆正。页面歪斜会干扰字符识别,倾斜的文档请先用 PDFora 的纠偏工具处理,再做 OCR。
- 语言设置要和文档一致。用英语模型去跑西班牙语信件,结果只会是一团乱码,反之亦然。
- 手机和老旧笔记本上速度会明显偏慢。引擎用的是你设备的处理器,100 页的扫描件该交给台式机,而不是五年前的平板。
- 数字要人工复核。OCR 很强但并非完美,账号和金额里的数字在你依赖它们之前值得用眼睛再扫一遍。
常见问题
我的扫描文档会被上传处理吗?
不会,这在在线 OCR 工具里很少见。Tesseract 引擎在你的浏览器内运行,每一页都在你自己的设备上识别,全程不向服务器发送任何内容,因此处理证件、合同和病历都很安全。
输出的是什么?
工具会提取识别出的文字,以可下载的 .txt 文件交给你。之后你可以搜索它、粘贴进文档,或送入任何需要纯文本的后续流程。
支持哪些语言?
目前提供英语、印地语、西班牙语和法语。识别前请选择与文档相符的语言,因为引擎会加载对应语言的模型,准确率高度依赖于选对语言。
文字识别的准确率如何?
对光线良好、干净的印刷体扫描件,准确率通常很高。照片模糊、字体特殊、手写体或严重倾斜都会拉低效果。输入质量是最关键的一环,页面质量差时先重扫或纠偏,别急着怪引擎。
为什么我这边的 OCR 比同事的慢?
因为处理在本地进行,速度取决于硬件。较新的笔记本每页只需几秒,老款手机则明显更久。本地处理的回报是完全的隐私。
页数或文件数有限制吗?收费吗?
不收费、免账号、无水印,也不限页数。你想把整个扫描件档案库都跑一遍 OCR 也可以。唯一实际的约束是时间,长文档在自己的机器上处理耗时更久。