TheNumbers.com AI 爬虫攻击迫使网站全面重建
- Ethan Carter

- 2小时前
- 讀畢需時 16 分鐘
2026 年 3 月 5 日,自动化流量压垮了一个已有 30 年历史的系统,同时安全日志显示,有人持续探测后门,导致 TheNumbers.com 下线。TheNumbers.com AI 爬虫攻击不仅中断了一个广受欢迎的电影数据库,还迫使其小型团队放弃约 160,000 个遗留源文件,并在新基础设施上重建公共网站。
该网站于 3 月 13 日恢复上线,但只是一个精简版本。历史榜单、单部电影页面和报告生成器均已缺失。据创始人 Bruce Nash 称,到 2026 年初,人类访问者仅占流量的约 10%。AI 机器人和其他自动化系统产生了其余 90% 的流量。
这种失衡是核心矛盾所在。开放网络曾以允许机器访问来换取人类发现内容。搜索引擎索引页面,并将读者引回网站。AI 爬虫和智能体可以获取多得多的内容,却几乎不带来流量,从而让独立出版者陷入一种代价高昂的关系。
此次停机还伴随着一种更令人不安的不确定性。据报道,服务器日志既显示了合法抓取,也显示了寻找隐藏访问点的尝试。目前没有公开证据能够确认攻击者身份,也无法证明这些探测行为导致了最终崩溃。
最明确的结论范围更窄,但依然严重。大量自动化流量耗尽了团队的资源,而反复的安全探测又让恢复旧系统变得过于危险。一个权威的公共数据库既成了宝贵的训练材料,也成了可能有利可图的攻击面。
TheNumbers.com AI 爬虫攻击摧毁的不只是一个网站
由于安全恢复旧服务器已不再可行,3 月的停机事件用一个临时空壳取代了成熟的公共参考系统。
The Numbers 是一项独立电影数据服务,由数学家、前 IBM 开发者 Bruce Nash 创立。它于 1997 年以一个收录 300 部电影的 Geocities 项目起步。到 2026 年初,其数据库已追踪 78,396 部电影、178,375 条院线上映记录和 236,176 位人物。
它的价值不仅来自规模。该团队收集并维护票房收入、上映历史、制作预算、家庭影音成绩和流媒体信息。记者、研究人员、电影制作人和行业分析师都将其视为重要的参考来源。
Stephen Follows 报道称,该网站在停机前每年获得超过 800 万次访问。他详细撰写的停机事件记录基于对 Nash 的一次长时间采访。它仍是有关此次事件技术时间线和内部估算的主要公开来源。
该网站于 3 月 5 日凌晨消失。用户没有收到详细解释,这引发了猜测,认为部分功能被撤下是为了推动访客转向商业产品。有限的公开消息仅表示团队正在重建网站。
八天后网站恢复上线时,仍能发布最新票房数据。然而,大部分历史界面已经消失。用户无法再像以前那样浏览许多熟悉的榜单、打开完整的电影页面或创建自定义报告。
这种功能缩减并非计划中的重新设计。Nash 表示,一位网络安全领域的联系人建议团队让旧服务器永久保持离线。恢复备份也会同时恢复同一个庞杂的攻击面,而自动化系统已经花费数月对其进行探查。
这一区别至关重要。备份能够保留软件和数据,但也会保留过时的依赖项、暴露的端点以及未记录的行为。服务器重新上线后,可能会立即再次落入同一批机器人和潜在攻击者的触及范围。
Nash 称,旧代码库约有 160,000 个源文件,为大约 200 万个页面提供服务。该架构是在近三十年间逐渐累积形成的。即使是一支能力出色的小型团队,也无法迅速检查每个组件、修补每个弱点,并证明整个系统是安全的。
因此,The Numbers 将最新的核心数据迁移到了新基础设施上。团队选择了可控恢复,而非快速还原。随着工程师在一个针对当今流量和安全环境设计的系统中重新构建各项功能,这些功能将逐步恢复。
公共网站并非该公司的全部业务。通过 OpusData 提供的批量数据、面向电影制作人和投资者的比较分析,以及一份订阅制行业报告仍在继续运营。这种业务分离帮助该组织在最受关注的服务仍受限制期间维持生存。
其他独立资源可能没有同样的缓冲空间。主要依靠广告、捐款或会员费资助的专业档案网站,一旦公共页面消失,就可能立即失去收入。其能否存续,可能取决于运营者能否在读者形成新习惯之前完成重建。
这些消失的页面也表明,保存有用知识所需要的不只是存储原始记录。界面、筛选器、报告和上下文链接决定了人们能否使用一个资料集合。数据库在技术上可以继续存在,但它的大部分公共实用性仍可能无法获得。
这个问题对于任何维护个人或组织可搜索知识库的人来说都很熟悉。只有当信息的存储、访问路径和运行环境始终可靠时,信息才具有持久性。
因此,这起突发事件并不仅仅是一次停机。电影行业信息基础设施中一个成熟的层级,被一项范围更窄的服务所取代。这次重建将多年工程投入从产品改进转移到了紧急恢复工作上。
自动化流量在系统崩溃前耗尽了团队精力
故障在两年间逐步形成,因为机器流量从可管理的索引活动转变为持续且大量消耗资源的数据提取。
Nash 将自动化流量的增长分为两波。第一波始于 2024 年左右,当时为 AI 训练收集材料的爬虫加入了传统搜索机器人之列。他表示,与成熟的搜索引擎爬虫相比,这些系统通常更不克制。
第二波始于 2025 年 12 月左右。Nash 将这次激增归因于智能体 AI,即能够根据目标或用户提示选择行动并访问网站的软件。这类流量包括由服务提供商运营的检索系统,以及个人用户创建的自定义智能体。
这些类别的行为并不完全相同。训练爬虫可能会系统性地复制大型资料集合。搜索机器人可能会重复访问特定页面以维护索引。由提示驱动的智能体可以在用户提出问题时请求深层页面,有时还会重复其他系统已经完成的工作。
对于 The Numbers 而言,这些因素共同造成了严重后果。Nash 估计,到 2026 年初,只有 10% 的流量来自人类访客。其余 90% 则来自 AI 机器人和其他自动化系统。
流量规模只是成本的一部分。Nash 表示,从 12 月到 3 月系统崩溃期间,团队约 90% 的时间都用于维持现有网站运行。只有剩余的时间能够继续开发替代系统。
这形成了一个反馈循环。自动化请求拖延了应对自动化请求所需的现代化改造。每一个用于封禁滥用地址、检查日志或重启服务的小时,都无法用于替换脆弱的遗留组件。
这一经历与更广泛的网络测量结果相符。2026 年 6 月,Cloudflare 观测到的爬虫请求中有 52% 与 AI 训练有关,高于 2025 年春季的 22%。混合用途爬虫占活动总量的 36% 以上。
更早的数据表明,单个机器人的份额增长速度有多快。2024 年 5 月至 2025 年 5 月期间,在 Cloudflare 的样本中,GPTBot 的原始请求量增长了 305%。它在 30 多个被测量的 AI 和搜索爬虫中的份额从 2.2% 增至 7.7%。
这种负担并未通过同等规模的引流得到补偿。Cloudflare 的爬虫分析发现,在其 2025 年的测量期内,训练活动占 AI 机器人活动的近 80%。2025 年 7 月,Anthropic 每带来一位被引荐的访客,大约会产生 38,000 次抓取。
不同网站面临的比例各不相同,Cloudflare 的网络也不能代表每一台服务器。但整体趋势十分明确。网站运营者可能收到反复的机器请求,却无法获得足够的读者、订阅者或许可客户来抵消这些工作。
The Numbers 曾尝试将这种压力转化为合法需求。它在网站上发布了机器可读的指引,引导 AI 系统获取数据许可,而不是进行抓取。Nash 表示,这些内容发布后,许可咨询量增长了约十倍。
这一结果表明,机器人并不一定具有敌意。部分智能体能够理解指令,并将用户引导至获准的访问方式。当自动化客户端遵守规则时,结构化的许可页面、应用程序编程接口和专用数据源可以减轻压力。
然而,这类措施无法控制所有爬虫。robots.txt 文件允许网站公布抓取偏好,但是否遵守仍完全出于自愿。对于隐藏身份、轮换地址或无视已公布规则的系统,则需要通过网络层面的检测和封禁来应对。
Electronic Frontier Foundation 曾警告称,部署不当的抓取器可能提高托管成本、降低性能并导致停机。其爬虫指南主张提供专用端点和围绕自动化需求设计的基础设施。
这些建议要求双方都承担责任。AI 公司需要设置请求限制、提供明确身份、采用缓存机制并建立可靠的合规控制。托管公司则需要提供易于使用的机器人管理功能,避免迫使每个小型出版者都成为安全专家。
网站运营者还面临分类难题。他们必须区分有益的搜索索引、档案收集、获许可的检索、实时用户智能体、训练爬虫、机会主义抓取器和恶意侦察。所有这些系统请求的都可能是相似的公共页面。
封禁一切可以保护服务器容量,但会减少内容发现和保存。允许一切可以保护开放性,但会让基础设施暴露在无限制的数据提取之下。小型运营者不得不在工程师更少、流量情报更有限的情况下做出这种权衡。
TheNumbers.com AI 爬虫攻击让这种失衡显现出来。其公共价值吸引了自动化需求,但满足这些需求的成本仍由维护该数据库的组织承担。
开放数据库变成了具有经济价值的攻击面
更深层次的逆转在于,当外部市场能将提前获取信息或操纵数据转化为金钱时,公共信息也可能变得值得攻击。
电影统计网站看起来不像传统的金融目标。The Numbers 无需持有支付卡记录或大量私人消费者信息,也足以吸引恶意关注。其公开发布的数据本身就可能具有经济价值。
预测市场提供了最明确的激励。一些市场接受对首周末票房成绩的投注,并指定 The Numbers 作为其结算来源。该数据库发布的最终数值决定哪些头寸获胜。
这种关系创造了超越普通抓取的机会。有人若能在数据发布前获取相关数字,便可能利用信息优势进行交易。有人若操纵显示的结果,则可能扰乱市场结算,尽管没有证据表明任何人曾成功篡改 The Numbers 的数据。
Nash 表示,日志中既包括使用合法 URL 的请求,也包括明显在寻找后门的其他请求。他认为,后者很可能旨在发布前获取数据,或操纵用户所看到的内容。这一解释合乎情理,但仍然只是他对日志的解读。
目前尚未公开确认任何具体攻击者。现有报道无法确定抓取和探测活动是否由同一方控制,也无法证明服务器故障究竟是资源耗尽、安全事件,还是两者相互作用所致。
在任何关于 TheNumbers.com AI 爬虫攻击的叙述中,这些限制都应处于核心位置。将这一事件称为已确认的 AI 主导入侵,会超出公开证据所能支持的范围。目前有记录的是持续的机器流量、自动化探测、服务器崩溃,以及由此作出的不再恢复旧系统的决定。
这种不确定性并不会让安全问题消失。现代编程助手能够识别常见弱点、生成请求序列、调整脚本并分析服务器响应。这些能力降低了检查大量老旧网站软件所需的人力成本。
同样的技术也可用于正当防御。安全团队使用自动化工具,在犯罪分子利用漏洞之前将其找出。自主测试平台能够提交有效的漏洞报告,并帮助组织检查超出人工审核者手动检查能力范围的更多代码。
区别在于授权和意图。防御性扫描器经许可测试系统,并通过约定流程报告发现。恶意代理则寻找其从未获准拥有的访问权限,并可能将自己伪装在正常请求之中。
Anthropic 2025 年的威胁报告描述了一场网络间谍活动,其中 AI 完成了针对约 30 个目标的大部分战术工作。Anthropic 表示,在每次行动中,人类操作者只在少数决策节点进行干预。
该案例并未将 Anthropic、Claude 或任何已确认的国家行为方与 The Numbers 联系起来。它为一个范围更窄的结论提供了行业背景:自动化工具能够降低开展持续侦察所需的专业能力和注意力投入。
老旧网站尤其容易暴露于风险之中。它们通常混合使用旧框架、自定义脚本、被遗忘的管理路径,以及在如今的机器人流量规模出现之前设计的数据库。它们的防御可能依赖隐蔽性和人工监控,而非持续的安全工程。
公共数据库也会诱发异常深入的导航。爬虫不会在读取首页后停止。它可以枚举电影记录、人物、榜单、上映日期、查询参数和报表组合,从而成倍增加应用服务器需要完成的工作。
这种行为可能模糊可用性攻击与侦察之间的界限。机器人可能在尝试收集合法页面的同时让服务器过载。另一个机器人则可能利用由此产生的流量作为掩护,同时测试异常路径。运营方必须在同一事件中调查这两种可能性。
商业背景又增加了一层复杂性。看似无害的公共数据可能充当预言机,即被信任用于结算交易的外部来源。一旦资金依赖其输出,该输出的完整性和时效性便会成为安全问题。
The Numbers 最初是为了帮助用户在 Hollywood Stock Exchange 上交易虚拟 MovieStocks 而创办的。近三十年后,据报道,真钱预测市场使用其公开页面结算票房合约。该网站的权威性改变了系统遭入侵所带来的后果。
这并不能证明预测市场交易者导致了此次宕机。它解释了为什么调查人员不能因为这是一个电影数据库,就将其视为不太可能成为目标的对象。一个可信参考来源无需改变其原始产品,也无需收集敏感客户信息,就可能变得具有重要的金融价值。
因此,主要矛盾在于开放性与不受控制的提取之间。发布详细数据为记者、研究人员、电影制作人、影迷、AI 系统和市场创造了价值,同时也增加了有动机复制、抢先利用或影响这些数据的行为方数量。
现有证据仍无法证明什么
已报道的事实支持一种累积压力的叙事,但不足以对最终故障作出明确归因。
最有力的证据来自 Nash 的陈述,以及其团队审查过的服务器日志。这些证据确认了运营方观察到的现象,但未必能说明是谁生成了每一个请求,或每个系统的意图是什么。
用户代理标签并非可靠的身份标识。合法爬虫可以清楚标明自己的身份,但滥用型机器人也可以模仿浏览器或其他服务。反过来,陌生的自动化请求也不一定具有恶意。
AI 和自动化系统产生了网站 90% 流量的说法同样属于内部估算。目前尚未发布独立审计、原始日志样本或测量方法。读者应将这一数字视为 Nash 基于掌握情况作出的陈述,而不是经验证的全互联网基准。
对崩溃机制也应保持同样谨慎。大量请求可能耗尽处理器时间、内存、数据库连接、文件句柄或带宽。安全探测可能触发代价高昂的错误,也可能利用某项漏洞。公开报道尚未确认具体的技术故障。
老化的架构仍可能是必要条件。采用缓存、静态页面、请求限制和托管防护的新系统,或许能够承受更多流量。这并不能为滥用式抓取开脱,但会影响我们对责任的理解。
网站年久并不等同于疏忽。独立信息服务之所以能够长期存续,往往是因为维护者更重视连续性,而非频繁重写平台。替换一个仍在正常运行的专业数据库,可能引入数据错误、破坏入站链接,并让有限的员工偏离研究工作。
The Numbers 已经开始开发改进后的系统。据报道,在最后几个月里,机器人管理占用了团队的大部分时间。该组织一边试图替换脆弱的架构,一边还要同时保护它。
正是在这一点上,该案例的意义超越了单一发布机构。最高质量的垂直领域资源往往较为老旧,因为持续的人工维护创造了其价值。它们积累的历史也使迁移成本高昂,并对自动化采集者更具吸引力。
与 Internet Archive 的比较表明,基础设施规模并不能消除威胁。2023 年 5 月,据报道,一家 AI 公司每秒发送数万次请求,从公共领域档案中提取文本。这些流量一度导致该服务离线。
根据 2026 年的一项档案调查,该组织两次屏蔽了流量来源,随后要求该公司以负责任的方式进行抓取。该公司后来道歉、停止抓取并进行了捐赠。
该案例也说明了不加区分地屏蔽所带来的危险。由于担忧 AI 提取,发布机构越来越多地限制档案爬虫。这些防御选择可以防止未经授权的重复利用,但也可能减少对具有历史重要性的网络资料的保存。
搜索引擎、档案服务、研究人员、无障碍服务和 AI 应用都依赖自动化访问。将每个机器人都视为敌对对象,会损害合法的公共功能。将每个公共页面都视为可供机器无限获取的输入,则会造成另一种损害。
更好的技术控制可以缩小这一矛盾。运营方可以为频繁请求的页面提供静态版本、实施速率限制、缓存常见查询、分离授权数据源,并使用 Web 应用防火墙。这些措施的部署和维护都并非没有成本。
AI 提供商也可以减少重复请求。集中式缓存、增量更新、公开的爬虫身份和可执行的限制,可以防止大量系统反复下载未发生变化的材料。付费或授权数据源则可以支持维护宝贵数据集的人员。
然而,授权市场无法解决恶意探测问题。攻击者没有动机遵守定价、爬虫指令或速率限制。因此,公共数据库既需要商业访问规则,也需要传统的安全防御。
对于小型团队而言,这一挑战尤其严峻。企业级服务可以聘请专职安全人员,并协商授权协议。独立档案服务可能只有一名维护者,需要同时兼顾数据质量、工程、客户支持和自动化滥用问题。
TheNumbers.com AI 爬虫攻击不应成为推行某种单一简单政策的借口。强制开放会把基础设施和安全成本转嫁给发布机构。全面屏蔽则会让知识集中到有能力负担受保护分发方式的大型平台手中。
相反,证据指向的是可问责的访问模式。自动化系统应当表明身份、尽量减少重复工作、尊重运营方的控制措施,并提供授权或移除渠道。托管服务商应让小型组织也能以可负担的成本使用这些控制措施。
在这种模式普及之前,Web 将继续转向防御性架构。更多页面将置于身份验证、托管接口、静态快照和合同约束的数据源之后。内容可能仍然可用,但开放表面将会缩小。
三个信号将表明重建能否解决问题
下一项考验是 The Numbers 能否在恢复公开内容深度的同时,不再重现令其旧网站陷入危险的条件。
第一个信号是历史页面和分析工具的回归。精简版保留了当前票房报道,但用户失去了该网站的大部分长期研究价值。恢复电影页面、榜单和 Report Builder,将表明重建已超越紧急维持服务连续性的阶段。
这些功能的发布顺序将揭示团队的优先事项。静态且频繁请求的记录,比灵活的报表工具更容易缓存和保护。如果复杂查询迟迟未能恢复,可能的限制因素并非数据缺失,而是在自动化需求下安全地提供数据。
第二个信号是 The Numbers 是否在人工访问与机器访问之间建立更明确的区分。Nash 表示,重建后的服务必须同时应对人类、搜索引擎、训练爬虫、提示驱动的检索、自主代理和预测市场用户。
这些受众不应获得完全相同的接口。人类需要可浏览的页面,而获得授权的系统可以使用具有可预测限制的结构化数据源。搜索引擎需要发现访问权限,而训练爬虫则需要单独的许可和使用规则。
该团队此前发布的机器可读授权指南提出了一条可行路径。Nash 表示,它使授权咨询量增加了约十倍。扩展数据服务可以将部分自动化需求转化为客户关系,同时为普通访客保留免费访问。
成功并不意味着封禁所有 AI 系统,而是将大规模数据提取转移到受控渠道,避免威胁公共网站。失败则可能表现为再次发生中断、工具永久缺失,或采取同样阻碍人类研究的激进限制措施。
第三个信号是基础设施提供商和 AI 公司是否采用可强制执行的爬虫规范。Cloudflare 已经提供网络层面的控制措施,并在试验基于权限的访问机制。其他托管服务商也必须提供同等保护,让没有专门安全团队的组织也能使用。
AI 公司应公布稳定的身份标识,区分模型训练与用户触发的信息检索,遵守速率限制,并避免重复下载。透明的爬取量与引流量对比数据也有助于发布者判断哪些系统提供了足够价值,值得允许访问。
更有力的行业应对将支持本文的核心判断:自动化访问是一种经济和运营关系,而非不受限制的权利。持续的模糊状态会迫使每个独立网站独自应对一个分布式系统难题。
读者还应关注归因证据。一份明确指出确切故障机制的技术事后分析,将加强或削弱不同的解释。若有未经授权访问的证据,这起事件的性质将从一个韧性问题实质性地转变为一起得到证实的安全入侵。
在缺乏此类证据的情况下,预测市场操纵仍只是一种理论。由于 The Numbers 充当结算来源,这一可能性值得调查,但不应被描述为已确定的原因。负责任的立场是同时承认其中的动机与证据缺口。
对于开发者而言,这一事件改变了公共应用程序的威胁模型。一个网站无需存储密码或支付数据也可能成为攻击目标。独特、及时且结构化的信息会催生数据提取、提前访问和操纵的动机。
对于发布者而言,这起事件表明流量统计为何已变得具有误导性。一次请求不再意味着有一位读者,而更多请求可能只会带来更高成本,却不会扩大触达范围。分析系统必须区分人类用户、有益爬虫、获授权的自动化访问和滥用行为。
对于 AI 产品用户而言,教训在于依赖关系。基于专业来源生成的答案可能掩盖这些来源本身的脆弱性。如果原始数据库失去流量、资金或可用性,下游 AI 工具最终也会失去可靠的素材。
对于知识工作者而言,这次中断提醒人们保留来源信息。AI 答案可以概括某个数字,但研究人员仍然需要底层来源、更新历史和方法论。即使复制的数据仍存在于其他地方,原始界面的消失也会增加核验难度。
开放网络依赖于那些因为内容有用而维护它们的组织,而不是因为每个页面都能立即产生收入。电影数据库、技术文档、地方档案、科学目录和专业论坛都属于这种模式。
自动化系统受益于这些长期积累的劳动成果。它们不应让原始服务变得更难运营。否则,AI 经济将会耗尽那些让其答案具备价值的可靠来源。
TheNumbers.com 得以维持,是因为在公共界面离线期间,其商业服务仍在继续。它的团队也掌握着重建所需的数据、专业知识和客户关系。许多独立网站都无法跨过这些门槛。
因此,最重要的问题并不是每一个老旧网站是否都应该抵制现代化,而是有价值的公共资源能否获得足够的控制权和支持,以便在自动化压力迫使其进入紧急状态之前完成现代化。
请关注 The Numbers 恢复了哪些内容、它如何区分机器访问,以及更广泛的爬虫生态系统是否变得更加负责。这些结果将决定 TheNumbers.com AI 爬虫攻击究竟只是一次孤立的警告,还是会成为独立网络的常见模式。


