你是不是也这样过?
想从招聘网站扒几个岗位标题做行业分析,结果发现「猎聘导出 Excel」要付费;想比价京东和淘宝的同款商品,手动复制粘贴二十页,手酸眼花还漏掉关键参数;甚至只是想把知乎专栏里那几篇长文自动存成 Markdown,都得翻教程、装 Chrome 插件、调选择器——最后卡在「$x = document.querySelectorAll(…)」这行代码上,关掉页面去刷短视频。
不是不想干,是太费劲。买个现成的爬虫工具?最便宜的月付也要 30 块,一年就是 360,还不包更新、不教你怎么改规则。更别说有些平台直接封 IP,买了也白买。
今天这个工具,我试了三天,抓了豆瓣电影 TOP250 的片名+评分+导演,又顺手扒了小红书某护肤合集的标题和点赞数——全程没写一行选择器,也没碰过 XPath。它不卖账号、不收年费、不弹广告,就一个 Python 包,装完就能用。
能替代什么 / 能省多少钱
它不替代某个具体名字的商业软件,但实实在在顶掉了三类你常掏钱的服务:第一类是「网页数据采集 SaaS」,比如八爪鱼、火车头这类按月订阅的可视化爬虫平台,基础版每月 98 元起,高级功能还要加钱;第二类是「定制爬虫外包」,朋友公司上周刚找人写了个抓电商评论的脚本,报价 1800 元,只跑三个月;第三类是「Excel 插件+人工补录」,像某些财务人员每周手动从政府采购网复制中标信息到表格里,一小时干不完,还容易错。
算笔账:如果你每月为这类事花 50 元(保守估计),一年就是 600 元。这个工具免费,MIT 协议,能一直用。哪怕你只用它半年,就省下 300 块,够买两本实体书,或者请自己吃顿好的。而且它不锁功能,不用看「免费版仅支持 100 条/天」这种小字条款。
核心功能
- 你给它一个网页链接,再告诉它「我要这几个词」,它自己学会怎么找,比如你输入「苹果股价 124.81」,它就能记住这个数字在 Yahoo 财经页面里的位置规律,下次换微软、谷歌的页面,照样精准抓出股价,不用重写规则。
- 抓的内容类型很实在:纯文本(标题、简介、价格)、超链接(文章原文地址、图片 src)、甚至 HTML 标签里的属性值(比如某个按钮的 data-id 或 class 名)。我试过抓 GitHub 仓库页的「Star 数」和「Issues 链接」,两个不同结构的数据,一条命令全拿下,顺序都不乱。
- 同一个模型能复用到多个相似网页。比如你用 Stack Overflow 的一个问题页训练好规则,之后所有问题页,不管 URL 是 /questions/606191 还是 /questions/2081586,都能直接调用,返回对应页面的「相关问题标题列表」。这点比手动写正则强太多,省得每个新页面都调试半天。
- 支持传入自定义请求参数。有些网站会反爬,需要加 headers 或走代理。它的 build() 方法里可以直接塞 requests 支持的参数,比如 proxies={‘http’: ‘http://127.0.0.1:8080’},我用本地 Charles 抓包调试时特别顺手。
- 模型能存成文件,下次直接加载。我昨天训练好的「抓豆瓣电影」模型,今天打开 Python 就 load(‘douban-movie’),三秒内开始跑新链接,不用重新喂样本。对经常要批量处理的人来说,这省下的时间比写代码还值。
- 它不依赖浏览器,纯 Python 实现,启动快、内存占用低。我在一台 4GB 内存的老笔记本上跑了十来个并发任务,风扇都没怎么转。不像某些基于 Selenium 的工具,开一个页面就占 300MB 内存。
三步上手
- 先确认你电脑装了 Python 3.6 或更高版本,Windows 用户去 python.org 下载安装包,勾选「Add Python to PATH」;Mac 用户如果没动过系统,大概率自带 Python3,终端输 python3 –version 看一眼就行;Linux 用户一般默认有,Ubuntu 可以用 sudo apt install python3-pip 补齐 pip。
- 打开终端(Windows 是 CMD 或 PowerShell,Mac 是 Terminal),粘贴这行命令回车:
pip install autoscraper
别怕,就这一行,没有依赖地狱,不会报错「failed building wheel」。我试了三次,两次秒装完,一次因为网络慢多等了 15 秒,但没失败。 - 新建一个叫 test.py 的文本文件,把官网示例里那段 Stack Overflow 的代码完整复制进去,保存后在终端里运行 python test.py。第一次运行会自动下载网页内容,大概 2-3 秒,然后直接打印出一串标题列表。看到结果那一刻,你就真的会心一笑,不是「它成功了」,而是「原来这么简单」。
要说清楚的短板
它不是万能的,有三个地方你得心里有数:第一,不支持中文界面,所有提示、报错、文档全是英文。如果你看到「AttributeError: ‘NoneType’ object has no attribute ‘find’」这种报错,得自己查 Python 错误类型,不能指望中文帮助。第二,动态渲染的网页(比如用 React/Vue 加载的无限滚动列表)它抓不到,因为底层没跑浏览器引擎。我试过小红书首页,它只拿到骨架 HTML,真实内容全空白。第三,它不提供图形界面,所有操作都在 Python 脚本里完成。想点点鼠标就出 Excel?不行。得写几行代码,再运行一下。这点对完全没接触过编程的人,门槛还是有的,但它比学 Selenium 简单十倍,真的一小时就能上手。
项目信息
alirezamika/autoscraper
GitHub
A Smart, Automatic, Fast and Lightweight Web Scraper for Python
8.0k
Stars
830
Forks
Python
MIT
Python 编写,GitHub 上 8001 颗星,MIT 开源协议。GitHub 项目地址
你用过类似的免费工具吗?评论区聊聊,我挑几个下期专门写。




