你是不是也这样:花 299 块买了某 PDF 编辑软件,结果导出表格还是错行、漏字、分栏混乱?
或者用在线 OCR 工具,一页收费 5 毛,导 100 页就是 50 块——还限制每天调用量、不支持批量、数据传到别人服务器上。
这些钱和时间,其实全花在了「把 PDF 里的文字和表格变成能复制、能搜索、能导入 Excel 的干净内容」这件事上。
替代了哪些付费软件
它不直接对标某个具体名字的软件,而是干掉了三类常见付费需求:PDF 转 Word/Excel 的会员服务、文档 OCR 的按页计费 API、还有企业里买来给大模型喂数据的「文档预处理平台」。
官方明确说:开源版永久免费,但精度比商用 API 低一点
比如某知名文档解析 SaaS,基础版每月 99 美元起;国内几家类似服务,单次解析 PDF 表格动辄 3–8 元。而 unstructured 的开源版,你装好就能本地跑,不联网、不上传、不计费。
价格直接砍到零。
核心功能
- 把扫描版 PDF、带图的 Word、甚至网页截图(需配合其他工具)自动拆成段落+标题+表格三类内容,不是简单 OCR,而是理解「哪块是标题、哪块是正文、哪块是表格」。
- 对 PDF 表格识别效果比普通 OCR 强不少:它会保留原始行列结构,导出为 CSV 或 Markdown 表格时,基本不会错位或合并单元格,这点在财务报表、合同条款页上特别实用。
- 支持 20 多种格式:PDF、DOCX、PPTX、HTML、EPUB、EML 邮件、甚至 ZIP 压缩包里的文件。你不用先手动解压、再一个个拖进去,它自己能递归处理。
- 能跳过页眉页脚和页码:很多合同、年报 PDF 每页都有重复水印或页码,它默认过滤掉,导出的文字更干净,不用后期手动删。
- 输出结果是标准 JSON 格式,每段文字都标好类型(text / title / table)、坐标位置、置信度。你可以直接拿去 Excel、Notion 或喂给本地大模型,不用再写脚本转换。
- 支持中文文本,但界面和文档全是英文。实际测试中,中文段落识别准确率不错,只是表格内中英文混排时,偶尔会把数字和单位分错行,这点官方没承诺,得你自己试。
三步上手
- 先去官网确认你电脑有没有装 Docker:Mac 和 Windows 用户直接下 Docker Desktop(免费),Linux 用户用 sudo apt install docker.io 就行;没 Docker 的话,也可以用 pip 安装,但文档提醒「Windows 上 pip 安装可能失败」。
- 打开终端(Mac/Linux)或命令提示符(Windows),粘贴这行命令:docker pull downloads.unstructured.io/unstructured-io/unstructured:latest,等它下载完(约 500MB)。
- 再执行 docker run -dt –name unstructured downloads.unstructured.io/unstructured-io/unstructured:latest,然后就能用 Python 脚本或 API 调用它了,官方给了现成的示例代码,复制粘贴改个路径就能跑。
项目信息
Convert documents to structured data effortlessly. Unstructured is open-source ETL solution for transforming complex documents into clean, structured
15.6k
Stars
1.3k
Forks
HTML
Apache-2.0
命令行方式更轻量:装好后直接运行 unstructured-ingest,后面跟上 –input-path 和 –output-dir,就能批量处理整个文件夹。
输出的 JSON 文件里,每个元素含 element_id、text、category、metadata 四个主字段,其中 metadata 又包含 page_number、file_directory、last_modified 等实用信息。
你用过类似的免费工具吗?评论区聊聊,我挑几个下期专门写。



