你有没有过这种时候:看到论文里一个漂亮公式,想抄到自己文档里,结果要么手动敲半天,要么打开收费 OCR 工具——结果识别错一堆括号和上下标,还得一行行改。有些工具连根号都认成“V”,积分号变“S”。我上周改一篇数学作业,光校对公式就花了 20 分钟。后来试了 pix2tex,截个图,3 秒出 LaTeX 代码,粘贴进 Overleaf 就能直接编译。它不卖会员、不弹广告,也不需要注册账号。
能替代什么 / 能省多少钱
它不是替代某一款具体软件,而是替代你为「数学公式识别」单独花钱的整类需求。比如 Mathpix(最常用的那个),个人版每月 5 美元,一年要 360 块;教育版便宜点,但得验证学生邮箱,而且只支持网页上传,不能截图即用。还有些国产 PDF 工具带公式识别功能,但基本是噱头,试过三款,识别率不到 40%,还动不动卡死。pix2tex 不收一分钱,MIT 协议允许商用,你拿它做课件、写论文、甚至帮孩子检查作业,都不用担心版权或续费。说实话,如果你每年为公式识别花过 100 块以上,这工具半年就回本了。
核心功能
- 截图后直接出 LaTeX 代码,不用上传、不走云端。我在 KDE 桌面下按 Ctrl+Shift+P 截图,松手就弹出窗口,左下角实时渲染预览,右键就能复制代码。它用的是本地模型,没网络也能跑,这点我很满意,毕竟有些公式涉及未公开数据,我不放心传到国外服务器。
- 自动适配截图分辨率。README 里说它会先判断图片该放大还是缩小再识别,我试了同一张公式图:原图 2000×1500 像素,识别失败;缩到 800×600 后,一次成功。它没让我手动调参,而是悄悄做了这事。
- 支持 Linux 下多屏截图。我双显示器,用 gnome-screenshot 默认只截主屏,但 pix2tex 的 GUI 会自动调用 slurp(wlroots 环境下)或 spectacle(KDE 下),框选任意区域都行。这点比 Mathpix 的网页版强太多,后者只能拖拽上传,没法精准框选。
- 命令行也能用。比如我存了一堆公式截图在 ~/math/ 目录,直接终端里敲
pix2tex ~/math/equation1.png,回车就打印 LaTeX,适合批量处理。不过命令行没预览,错了得重来,所以我日常还是用 GUI。 - 温度参数可调。默认点击“Retry”会换结果,但把 temperature 设成 0.3 后,连续五次截图同一张图,输出完全一样。这点对教学很实用,我要给学生发标准答案,不能每次识别都变样。
三步上手
- 确认你的系统是 Linux(Ubuntu/Debian/Fedora 都行),已安装 Python 3.7+ 和 pip。如果没装过 PyTorch,先去 pytorch.org 复制对应命令执行(官网有中文镜像选项,选 Linux + Pip + Python,别选 CUDA 版,除非你真有 NVIDIA 显卡)。
- 打开终端,输入
pip install "pix2tex[gui]"回车。第一次运行时会自动下载约 1.2GB 的模型文件,我用校园网大概等了 4 分钟,之后就不用再下了。 - 安装完后,终端输入
latexocr回车,GUI 就弹出来了。点中间的「Take Screenshot」按钮,它会自动调起截图工具,框选公式区域,松手后 2-3 秒就显示 LaTeX 代码和 MathJax 渲染效果,Ctrl+C 复制即可。我建议第一次用时先试一张清晰的手写公式图,别急着扫印刷体 PDF,那得先转成 PNG 再截。
项目信息
pix2tex: Using a ViT to convert images of equations into LaTeX code.
16.6k
Stars
1.3k
Forks
Python
MIT
Python 语言,GitHub Star 数 16581,MIT 开源协议,GitHub 项目地址
你用过类似的免费工具吗?评论区聊聊,我挑几个下期专门写。




