PDF 转文字总出错?13k 星开源工具,200 毫秒搞定
给 AI 喂资料,最烦的就是 PDF。扫描件乱、排版复杂、转出来的文字缺行断页——每次都要折腾半天。GitHub 上最近有个叫 **pdf-inspector** 的开源项目,专治这个,13k 星,它能在 200 毫秒内搞定本地 PDF 处理。
它的厉害之处在于"先分清敌我":拿到一个 PDF,它先判断这是普通文本型,还是扫描图片型。普通文本型的直接提取,快得像闪电;只有真正需要 OCR 的扫描件,才走更慢的识别——因为它知道,市面上超过一半的 PDF 根本不需要浪费算力去"拍照识别"。
对打工人来说,这意味着什么?你那份几十页的电子合同、报表、论文,以前要开专业软件、装插件、等半天;现在一个命令,AI 就能直接读懂里面内容,还能转成方便喂给 AI 的格式,表格、段落都不乱。
这工具背后是 firecrawl 团队,给不少大厂做文档解析的,技术底子扎实。缺点是要懂一点命令行,普通人用起来有门槛;但它开源的思路很对——把"贵而慢"的 OCR 留给真正需要的文件。
PDF 是职场绕不开的坎,这个免费工具至少让 AI 读 PDF 没那么痛了。
ai 人工智能 效率工具
