AI爬虫失控:kernel.org过半算力被吞噬

AI爬虫正以天文级请求量蚕食kernel.org等开源基础设施的算力,引发开放Web的可持续性危机。
Linux内核官方Git仓库git.kernel.org的维护者披露,当前消耗在为AI爬虫渲染commit页面上的CPU算力,已超过所有合法用户访问的总和——5个节点上随时有14个CPU核心专职服务爬虫。根本原因在于:Git仓库的Web前端天然具有近乎无限的可爬取URL空间,且每个页面都需要实时计算生成,计算成本极高;而当下的AI数据采集爬虫普遍不遵守robots.txt、采用分布式IP规避限流,将采集成本完全转嫁给公共基础设施。这一困境并非kernel.org独有,维基媒体基金会、各类文档站点和开源平台均受波及。现有防御手段(缓存、速率限制、工作量证明挑战)均以牺牲开放性为代价,且治标不治本。文章指出,这是一个深层的AI伦理与结构性问题:AI公司从公共财富中采集数据创造商业价值,却将算力账单留给了无偿的开源维护者。
当爬虫成为服务器的最大负担
开源基础设施正面临一个前所未见的困境:为AI训练数据而生的网络爬虫,正以近乎恶意的方式榨干公共服务器的计算资源。Linux内核项目的核心维护者Konstantin Ryabitsev近期在其博客文章《Creepy crawlies》中,揭示了 git.kernel.org 所遭遇的严峻现实。
作为Linux内核的官方Git仓库,git.kernel.org承载着全球开发者的代码克隆、提交查看等合法访问需求。然而Ryabitsev给出的数据令人震惊:
太长不看版:我们在为爬虫渲染commit页面上消耗的CPU算力,超过了所有其他合法访问(包括git克隆)的总和。在任意时刻,横跨5个地理分布节点,有14个CPU核心什么都不做,只在为爬虫渲染git提交的HTML页面。
换句话说,一个服务于全球开源社区的关键基础设施,其大部分算力并没有服务于真正的用户,而是被AI爬虫「背景辐射」般的持续侵扰所吞噬。

Git仓库为何成为AI爬虫重灾区
近乎无限的URL空间
Git仓库的Web前端(如cgit、gitweb等)天然是爬虫的噩梦。每一个commit都有独立的HTML页面,每一个文件的每一个历史版本都可以生成一个URL,diff视图、blame视图、按路径浏览的树状结构——这些组合在一起,构成了一个近乎无限的可爬取页面空间。
对于拥有数十万次提交、跨越三十余年历史的Linux内核仓库而言,可供爬取的独立URL数量是天文数字。更关键的是,渲染这些页面并非静态文件读取,而是需要实时调用Git底层命令、计算diff、生成语法高亮的HTML——每一次请求都意味着实打实的CPU消耗。
AI爬虫不再遵守传统规则
传统的爬虫礼仪——遵守robots.txt、控制请求频率、标识真实User-Agent——在当下的AI数据采集浪潮中正在失效。为了给大模型喂养训练数据,大量AI爬虫采用分布式IP、伪装身份、无视爬取限制的激进策略。它们不关心目标服务器的承受能力,只关心尽可能多、尽可能快地抓取数据。
这种「不计成本」的采集方式,将本应由采集方承担的计算成本,转嫁给了被采集的公共基础设施。对于依靠志愿者和捐赠维持运转的开源项目而言,这是一种实质性的资源掠夺。
不止kernel.org:蔓延的开源基础设施危机
这篇文章之所以引发广泛共鸣,是因为它戳中了整个开源与开放Web生态的痛点。知名开发者、Datasette项目作者Simon Willison在转发时坦言,他从Datasette的角度对此深感忧虑——Datasette是一个用于探索和发布数据的开源工具,会生成海量可被爬取的网页。
我从Datasette的角度非常担心这个问题,它对外提供了极其庞大的可爬取网页数量。
事实上,过去一年多来,从维基媒体基金会到各类代码托管平台、文档站点,都在陆续披露AI爬虫带来的流量激增和成本压力。许多小型开源项目甚至被迫在爬虫流量面前选择限流、加验证码,或者干脆关闭部分公开功能——这与开放共享的初衷背道而驰。
应对AI爬虫的技术手段与深层矛盾
运维者手中有限的防御工具
面对失控的AI爬虫,运维者的应对选项其实相当有限:
- 缓存渲染结果:将高频访问的commit页面缓存为静态内容,减少重复计算;
- 速率限制与IP封禁:识别异常访问模式并加以限制,但面对分布式爬虫效果大打折扣;
- 人机验证机制:引入类似Anubis这样的工作量证明(Proof-of-Work)挑战,让爬虫付出计算代价,但这也会牺牲正常用户的体验;
- 限制深度爬取:通过robots.txt和路径规则引导,但前提是爬虫愿意遵守。
然而这些手段都是「治标不治本」,且往往以牺牲开放性和可访问性为代价。当一个公共资源不得不筑起高墙来自保时,Web最初的开放理想已然受损。
Anubis是一个值得展开说明的防御工具。它由开源开发者Xe Iaso创建,核心思路是在HTTP层引入「工作量证明」挑战:当服务器检测到疑似爬虫的请求时,会要求客户端浏览器在本地运算一道哈希难题(通常基于SHA-256),只有解出答案才能获准访问。普通用户的浏览器可以在毫秒级内透明完成这道题,几乎无感知;而大规模并发爬虫则需要承担成倍的计算开销,从而失去经济上的可行性。这一方案的局限同样明显:无头浏览器(headless browser)类爬虫可以执行JavaScript从而通过挑战,且对于依赖原始HTTP抓取的合法机器人(如搜索引擎爬虫)也会形成误伤。因此Anubis更多是一种「提高攻击成本」的缓解措施,而非彻底解决方案。
AI数据采集的伦理拷问
这场危机的本质是一个AI伦理问题。正如原文所标注的ai-ethics标签所暗示的,问题的根源在于:AI公司在采集数据训练模型、创造巨大商业价值的同时,将采集成本外部化给了公共基础设施的维护者。
这些被爬取的数据——无论是Linux内核的提交历史,还是各类开源文档——本身是无数贡献者无偿创造的公共财富。而如今,这份公共财富不仅被大规模抓取用于训练闭源商业模型,其托管者还要额外承担因此产生的算力账单。这种权责失衡,是当前AI数据生态中一个亟待正视的结构性问题。
这一问题在法律层面同样存在争议。部分AI公司援引「合理使用」(fair use)原则为大规模爬取辩护,但该原则在各国法律体系中适用范围不同,且主要针对版权问题,并不涉及爬取行为对服务器造成的实际损害。目前学界和业界正在讨论的潜在机制包括:强制要求AI爬虫在robots.txt中遵守专属的爬虫标识协议(如GPTBot、CCBot等)、建立数据许可交易市场,以及效仿广播版权集体管理组织,由AI公司向内容提供者支付「训练数据使用费」。然而这些方案均缺乏强制执行的国际框架,大量境外爬虫运营者实际上处于监管真空之中。
开放Web正站在十字路口
kernel.org「14个CPU核心专职服务爬虫」的画面,是一个极具象征意义的缩影。它提醒我们,AI浪潮之下,开放共享的Web基础设施正承受着前所未有的压力。如果没有更合理的爬虫规范、数据采集协议,以及AI公司对公共资源的责任分担机制,越来越多的开放服务或许会被迫走向封闭。
对于每一个运营着可爬取网站的开发者和组织而言,这不是一个遥远的隐忧,而是正在发生的现实。如何在保持开放的同时守护住有限的算力资源,将是接下来相当长一段时间内绑不开的命题。
相关推荐

Claude Code国内安装与实战开发全流程指南
详解Claude Code在国内环境下的安装配置、基础环境准备及代码实战全流程,涵盖典型工作流、提示词工程技巧与学习路径建议,帮助开发者快速上手AI编程助手。

AI逆向实战:滑动拼图验证码破解全流程解析
详解AI逆向破解滑动拼图验证码的完整流程,对比古法逆向与AI逆向的效率差异,涵盖WASM加密分析、图像还原算法、轨迹模板匹配等核心技术环节,探讨AI如何改变逆向工程师的工作方式。

AI Agent的Harness工程:从MVP到团队级规则的治理框架
探讨AI Agent能力越强越需要Harness约束框架的核心逻辑,涵盖MVP设计思路、双轨留痕机制、学习信号提取及规则从任务级升级到团队级的完整方法论,帮助团队构建可控、可追踪、可持续演进的Agent治理体系。