Cloudflare 揭示了开放网络上 AI 爬虫的真实成本
- Aisha Washington

- 6月6日
- 讀畢需時 7 分鐘
已更新:6月17日

构建了现代互联网的握手协议正在破裂。几十年来,互联网一直运行在一个不成文的协议之上:出版商创建内容,搜索引擎对其进行索引,并将流量引导回源头。这是一个创作与发现的共生循环。这一循环现在正被AI scrapers拆解。
最近发布的数据显示,Cloudflare强调了这种干扰的巨大规模。在短短五个月的时间里,这家网络基础设施公司拦截了超过 4160 亿次来自 AI 机器人的请求,这些机器人试图从那些不希望被抓取的网站中获取数据。这不仅仅是一个技术上的麻烦;它对互联网商业模式构成了生存威胁。随着 AI 公司竞相摄取每一份可获取的人类知识来训练其模型,他们正在迫使人们从根本上重新思考网络的运作方式、谁为此付费,以及谁拥有其中的数据。
4160 亿次请求:AI 爬虫的爆发式增长

这些数字难以具象化。4160 亿次被拒绝的请求代表了全球服务器基础设施正遭受着持续不断的自动化攻击。Cloudflare 首席执行官 Matthew Prince 最近的言论强调了形势的严峻性。他指出,AI scrapers 的数量已经达到了扭曲互联网流量指标并让网站所有者蒙受真金白银损失的程度。
对于小微企业和独立出版商来说,这种 bot traffic 并非无害。当人类访问网站时,他们可能会点击广告、购买产品或订阅新闻通讯。这其中存在价值交换。而当 AI 机器人访问时,它吸走了文本、图像和代码,留下的只有服务器带宽的账单。
Reddit 等平台上的社区讨论让我们得以窥见底层遭受的损害。系统管理员报告称,隔夜流量激增——从每日 4,000 名访客跃升至 100,000 名——其中绝大多数请求是非人类发出的。这些网站被迫扩大其基础设施规模以应对负载,这实际上是在变相资助万亿美元科技巨头的研发部门。如果没有像 Cloudflare 这样的防御层来过滤这些噪音,许多小型网站会直接因流量费而破产。
这种现象正将互联网推向一种“付费参与”的防御架构。如果你负担不起企业级的机器人(bot)防护,你的内容就会变成下一代大语言模型(LLM)的免费原材料。
Cloudflare 在捍卫旧互联网商业模式中的角色

Cloudflare 在这个新时代已有效地将自己定位为互联网的守门人。通过阻截数十亿个 AI scrapers,他们所做的不仅仅是节省带宽;他们正试图维护广告支持模式的生存能力。互联网商业模式。
挑战在于,数据抓取的演变速度超过了传统的封锁方法。 在过去,一个简单的 robots.txt 文件——即在门口贴一张礼貌的告示,请求机器人不要进入——就足够了。合法的公司都会遵守它。如今,人工智能霸权的争夺导致这些规范被忽视。虽然一些 AI 公司声称尊重退出机制,但技术层面的现实往往更加模糊。
Cloudflare 的防御依赖于识别“明显的”抓取工具,但“明显”的定义每天都在变化。正如 Prince 所指出的,一些 AI 公司被发现伪造 User-Agents,伪装成 Windows 笔记本电脑上的标准 Chrome 浏览器,以潜入防御系统。这迫使 Cloudflare 依靠指纹识别技术,分析 TLS 握手(JA3/JA4 指纹)和行为模式,而不仅仅是信任机器人自称的身份。
对像这样的中心化实体的依赖 Cloudflare 来监管网络引发了人们对中心化的担忧。然而,对于大多数网站管理员来说,另一种选择——任由 AI scrapers 肆虐——无异于经济自杀。
Google 垄断与搜索-训练陷阱
技术社区的一个主要争论点涉及搜索索引与 AI 训练之间模糊的界限。这在 Google 的行为中表现得最为明显。用户和网站管理员对他们所认为的滥用 Google monopoly 的行为表达了越来越多的不满。
核心问题在于控制缺乏细粒度。多年来,屏蔽 Googlebot 意味着从 Google Search 中消失——这对大多数在线业务来说无异于死刑。现在,Google 正在利用其爬虫来喂养其 AI 概览和模型。虽然 Google 引入了扩展控制项,但社区的普遍看法是这是一个陷阱:如果你想在 Search 上被人类找到,你就必须允许 Google 用你的作品来训练其 AI。
这种服务捆绑利用了 Google 在搜索领域的统治地位,强制要求在 AI 领域服从。这让出版商陷入了进退两难的境地。他们要么屏蔽 AI 爬虫,然后逐渐被世人遗忘;或者放任它们进入,眼睁睁看着自己的内容被 AI 生成的回答所吞噬,从而导致原始网站废弃。这种动态正在加速人们逃离开放网络的趋势,因为创作者们意识到,保护自己作品的唯一方法就是将其锁起来。
技术对抗措施:Cloudflare 如何检测 AI 爬虫
这场发生在 Cloudflare 与 AI 爬虫 之间的战争是一场技术军备竞赛。仅仅封锁已知恶意 IP 地址列表已经不够了。AI 开发者正在利用庞大的住宅代理网络——通过毫无防备的普通用户的家庭互联网连接来路由其爬取流量——使他们的机器人看起来像普通人。
Cloudflare 利用机器学习模型来检测这些异常。他们寻找:
请求速率: 人类不会在一秒钟内打开 50 个页面。
浏览器一致性: 浏览器的 JavaScript 执行情况是否与其声明的 User-Agent 匹配?
导航模式: 真实用户会移动鼠标、滚动和犹豫。机器人则以直线移动或直接跳转到 API 端点。
这种技术过滤至关重要,因为数据抓取 的成本是不对称的。AI 公司发送请求的成本微乎其微,但出版商在提供页面、处理数据库查询以及支付数据传输费用方面的成本要高得多。
“死网”理论与内容创作者权利

无休止的 AI scrapers 活动正在助长曾经非主流的概念——Dead Internet Theory(死网理论)。该理论认为,互联网上的大部分活动都是机器人与机器人之间的对话,而人类仅仅是旁观者。随着 Cloudflare 拦截了数千亿次请求,这一理论看起来不再像是阴谋论,而更像是一个仪表盘上的指标。
这种环境对 content creator rights(内容创作者权利)极不友好。作家、艺术家和记者眼睁睁地看着自己的作品在未经许可或没有补偿的情况下被摄取。这些 AI 模型的输出随后让网络充斥着合成内容,而讽刺的是,这些内容随后又被其他机器人抓取。我们正趋向于一个递归循环,即 AI 在 AI 生成的内容上进行训练,这可能会降低模型质量——研究人员称之为“模型崩溃”(model collapse)。
如果创作者无法变现他们的作品,因为 AI scrapers 在人类访问网站之前就提取了价值,那么创作高质量、原创内容的动力就会消失。其结果是网络充斥着 SEO 垃圾信息和幻觉事实,而高价值的人类见解则退缩到付费墙和登录界面之后。
接下来会发生什么?围墙花园与付费访问
来自 Cloudflare CEO 的警告很明确:开放、免费的互联网时代正在结束。对激进 AI scrapers 的回应很可能是网络的分碎片化。
我们已经看到“围墙花园”的兴起。像 Reddit 和 Twitter 这样的平台已经锁定了它们的 API,并限制了未登录访问以防止抓取。新闻出版商正在起诉 AI 公司并签署独家许可协议。而无法获得此类交易的普通博客或论坛则处于弱势地位。
最终,互联网可能会分裂成两个层级:一个是由机器人和 AI 垃圾内容主导的混乱公共网络,以及一个人类在经过验证的空间中互动的私密认证网络。Cloudflare目前正在坚守阵线,但防火墙只是权宜之计,而非解决商业模式缺陷的方案。除非出现数据溯源和补偿的新标准,否则这 4160 亿次被拦截的请求仅仅是一场持久冲突的开端。
FAQ
为什么 AI 爬虫对小型网站有害?
AI scrapers消耗大量的服务器带宽和计算资源,却不浏览广告或购买产品。这增加了网站所有者的托管成本,却带来零收益,本质上是强迫小型出版商为 AI 模型的训练买单。
Cloudflare 如何区分人类和 AI 机器人?
Cloudflare 使用先进的指纹识别技术,分析浏览器与服务器之间的“握手”(TLS 指纹识别),以及鼠标移动和请求时序等行为分析。它会寻找访问者自称的身份(例如“我是 Chrome”)与其技术行为之间的差异。
我可以在不屏蔽 Google 搜索的情况下屏蔽 Google 的 AI 吗?
目前,这在技术上非常困难,也是关于 Google Monopoly 争议的焦点。虽然 Google 正在引入新的控制标签,但许多网站管理员认为这些机制刻意模糊,实际上是强迫网站如果想在搜索结果中保持可见,就必须允许 AI 抓取。
与抓取相关的“死网理论”(Dead Internet Theory)是什么?
“Dead Internet Theory”认为,很大比例的网络流量和内容是由机器人而非人类生成的。关于 Cloudflare在短短五个月内拦截了 4160 亿次机器人请求,这一事实支持了自动化代理正成为互联网主导力量的观点。
AI 抓取会改变我们使用互联网的方式吗?
是的,它已经在将互联网商业模式 推向“围墙花园”。为了阻止抓取,越来越多的网站正强制用户登录或支付订阅费用才能查看内容。这使网络从开放访问转向封闭且经过验证的平台系统。


