文章摘要
Y Combinator孵化的Firecrawl团队推出离线开源OCR工具OCR It,它是免费浏览器插件,可20毫秒内将不可复制PDF转为AI可直接读取的Markdown,全程离线处理,速度比同类工具Docling快近300倍,发布后登上GitHub热榜,目前对复杂版式PDF的识别效果仍有待优化。

曾经手动提取PDF文字时不仅效率低下,还常出现大量乱码,即便成功提取也难以让AI直接读取使用的窘境——

如今终于迎来了解决方案!

由Y Combinator孵化的Firecrawl团队推出了全新开源OCR工具OCR It,其联合创始人兼CTO Nicolas Camara宣布,这款工具可以在20毫秒内完成一份不可复制PDF的全文字提取,并将内容转化为格式清晰的Markdown文件,让AI可以直接读懂利用。

20毫秒的处理速度是什么概念?相当于用户点击确认后还没完成一次眨眼,一份格式规整的Markdown文件就已经生成完毕。这款工具完全无需联网,通过内置的Tesseract实现100%离线处理,刚发布就登上了GitHub热门榜单。

团队负责人介绍,在处理质量与Docling旗鼓相当的前提下,OCR It的处理速度比Docling快了近300倍,不少实测用户也在社交平台上称赞其速度表现亮眼。

便捷的操作方式

OCR It是一款面向Chrome和Firefox的免费浏览器插件,用户只需完成一次区域框选,之后通过快捷键或自动模式,就能将整本书或整个文档转换为完整可编辑的纯文本,方便直接输入AI进行总结或提问。

工具自带自动停止机制,当连续识别到两张相同页面、无法继续翻页、OCR识别失败或是达到300页上限时,会自动终止任务,避免在末页重复抓取。

工具支持手动和自动两种操作模式,具体流程如下:(注:Windows和Linux用户需将快捷键中的Option键替换为Alt)

1. 手动模式

  • 框选与识别:首先按下Option+Shift+R框选需要识别的文字区域,确认无误后按Enter保存;完成框选后,按一次Option+Shift+S即可开始识别当前页面,识别完成后工具会自动翻到下一页,用户只需重复该操作直到整个文档识别完毕。如果想要进一步节省时间,也可以一边翻页一边在每一页按下Option+Shift+S,系统会立即截图并在后台排队执行识别任务。
  • 文本导出:全部识别完成后,用户可以在插件面板中查看、修改文本,也可以单独重新识别某一页,最后选择“Copy all”或“Download .txt”导出全文即可。

2. 自动模式

自动模式更为简便,只需按下Option+Shift+A或是点击“Start auto-run”按钮,工具就会自动循环执行“截图—OCR识别—翻页”的流程,直到文档结束。如果需要中途终止任务,按下ESC键即可,后续的文本检查流程与手动模式一致。

此外根据项目仓库信息,OCR It无需API密钥,也不需要联网,安装过程中不会索要额外的网站权限,仅在需要自动运行或操作跨域iframe时,才会按需申请当前站点的权限。需要注意的是,目前浏览器内置的PDF阅读器暂不支持自动翻页,因此处理这类PDF时建议使用手动模式。

当前的局限性

不过OCR It并非完美的解决方案,目前它只能流畅处理版式简单、文字清晰的PDF文档,对于存在标题、脚注、表格、数学公式与正文段落混排的复杂页面,识别效果还不够稳定,仍有不少提升空间。

团队后续还将对工具进行迭代更新,感兴趣的用户可以前往项目仓库了解更多细节,也欢迎分享自己的实测体验。

参考链接:

[1]https://x.com/nickscamara_/status/2083295265793212827

[2]https://github.com/thiagotigaz/ocr-it

[3]https://www.firecrawl.dev/about

以上内容不代表本平台立场,仅供读者参考