一个收录美国慈善家资料的网站,用一年时间亲身验证了「互联网流量里到底有多少是真人在看」这个问题。PatronView 是一个拥有 150 万份个人主页的数据库,数据来自对美国国税局 990 表、公开捐赠墙和年度报告的公开抓取。它的运营者在一篇长文里,把这一年跟爬虫搏斗的经过、失败的尝试和目前奏效的手段都摊开了。

最刺眼的数字出现在今年 4 月 22 日。那一天,PatronView 单日收到了 360 万次请求,来源是 361844 个独立 IP,而且几乎全都位于中国。运营者调侃着想象了这些机器人长什么样,但数字本身是真实的。
同行的数据更能说明问题。Cloudflare 曾披露,Anthropic 的爬虫大约每带来一个被引荐的访客,会发起约 3000 次抓取;而 PatronView 运营者实测的比例是 35000 比 1。就在发稿前几天,他还封掉了亚马逊的 AI 搜索爬虫——那个爬虫每天读取 11.7 万页,却从没给网站带来过一个真实访客。
验证码也没能拦住什么。PatronView 的验证码通过率只有 0.24%,也就是说,机器人甚至懒得尝试破解,直接放弃,转而去撞下一页。更隐蔽的是统计盲区:运营者用自托管的 Plausible 做访问统计,这款工具只记录会执行 JavaScript 的访客,而几乎没有机器人会这么做。表面上看,网站每天只有约 500 个访客,显得很安静;但服务器每周要应答数百万次真实请求。发稿那一周,服务器对外应答了 250 万次请求、吐出 128 万整页,而可见的页面浏览量只有 5977 次——换算下来,每 1 次真人加载背后,约有 214 次机器人加载。
传统 SEO 爬虫同样不消停。SemrushBot、AhrefsBot、MJ12bot、DataForSEOBot 这类工具反复爬遍每一个页面,光靠 robots.txt 根本请不走。运营者最终在 Cloudflare 层面逐条加安全规则才勉强挡住。
这件事的启示并不复杂:今天大多数网站的流量早已不是真人。可见的访问统计和实际服务器负载之间,隔着一道巨大的、由机器人组成的鸿沟。对一个靠公开数据起家的「爬虫」网站来说,反爬成了一场没有终点的猫鼠游戏。
来源:PatronView







