你是否经常遇到这样的困扰:上传一份PDF,却不知道它到底是“能复制文字”的电子文档,还是“只能看不能选”的扫描图片?传统PDF解析工具要么强行OCR(慢、贵、易出错),要么直接报错放弃——而pdf-inspector就像一位经验丰富的PDF医生:不打开全文、不调用OCR,仅用毫秒级采样就能精准“把脉”PDF类型,并一键输出带格式的纯文本、结构化Markdown甚至表格。它专为开发者设计,让PDF处理从“碰运气”变成“有依据”。
核心功能
- 秒级智能分类:10–50ms内准确识别PDF是纯文本型、扫描图像型、纯图型或混合型,并返回0.0–1.0置信度分数,自动标记每页是否需要OCR——帮你省下54%不必要的OCR费用
- 位置感知文本提取:不仅提取文字,还保留原始X/Y坐标、字体大小/粗细/斜体信息,智能还原多栏排版、图文混排的真实阅读顺序
- 语义化Markdown生成:自动识别标题层级(H1–H4)、列表(编号/字母/符号)、代码块(检测等宽字体)、超链接、页面分隔符,输出可直接用于文档系统或AI提示词的干净Markdown
- 无OCR表格理解:基于矩形框分析+启发式规则,无需图像识别即可提取表格结构(支持合并单元格推断),对发票、报表、学术论文表格效果出色
- 全平台开箱即用:提供Rust原生库、Python包(pip install)、Node.js模块(npm install)及浏览器WebAssembly版本,服务端、桌面脚本、前端应用均可无缝集成
- 极致轻量高效:Rust编写,单文件解析平均耗时<200ms,内存占用低,适合高并发文档预处理场景,如AI知识库构建、合同自动化审阅、教育资料批量入库
适合哪些人用
这款工具特别适合:AI应用开发者(为RAG系统预筛PDF质量)、文档自动化工程师(构建合同/发票/论文处理流水线)、科研与教育工作者(批量转译教材PDF为可编辑笔记)、前端工程师(在浏览器中实时解析用户上传的PDF并预览结构)、以及任何厌倦了“一上传就卡顿、一解析就乱码”的PDF处理体验的技术决策者。
快速上手
安装极其简单,按需选择语言生态:
- Python用户:执行
pip install pdf-inspector,5行代码完成分类+Markdown导出 - Node.js用户:运行
npm install @firecrawl/pdf-inspector,支持ESM/CommonJS,API简洁如inspect(pdfBuffer).then(result => console.log(result.markdown)) - 浏览器前端:引入WASM版本,无需后端,用户上传即分析,隐私敏感场景的理想选择
- Rust项目:添加
pdf-inspector = "0.8"到Cargo.toml,享受零拷贝高性能解析
所有版本共享同一套智能逻辑,结果一致,文档齐全(含中文示例),新手10分钟即可跑通首个PDF分析任务。
项目信息
Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing de
7.9k
今日 +1,769 stars today
Stars
528
Forks
Rust
MIT
编程语言:Rust|GitHub Star 数:7911|开源协议:MIT|GitHub 项目地址
由Firecrawl团队开源,已在生产环境支撑每日百万级PDF智能路由,是当前中文社区最值得信赖的轻量级PDF“智能预检”方案。


