# TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：nickthegreek
- 发布时间：2026-07-24 02:35
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrxvduwi02z1roxph1bvkmmu
- 原文链接：https://stephenfollows.com/p/what-just-happened-to-thenumberscom-should-worry-us-all

## 精选理由

这是AI爬虫摧毁开放网络的一个缩影，Bruce Nash的访谈揭示了小站点面对工业化爬取的绝望，无论是否运营网站，都值得看清这个正在坍塌的旧互联网。

## AI 摘要

电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线，一周后仅以精简版恢复上线，历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露，AI 爬虫和智能体流量占其总流量的 90%，服务器在持续重压下崩溃，日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统，在新基础设施上重建网站。

## 正文

如果你在电影行业或相关领域工作，那么本月你很有可能使用过 The Numbers 的成果，无论你是否意识到这一点。

它通过人工调研获取的数据质量最高，追踪了超过 78,000 部电影的票房收入、预算、家庭录像和流媒体数据，涉及 236,000 名从业者。该网站每年访问量超过 800 万，被记者、学者、电影制作人、预测市场甚至吉尼斯世界纪录视为绝对的权威来源。

正是这种“史上最佳”的地位，导致了今年三月的灾难性事件。

2026 年 3 月 5 日，TheNumbers.com 网站消失了。

该网站宕机超过一周，没有任何解释。一周后，它重新上线，但规模大幅缩水。历史图表、单个电影页面，甚至备受喜爱的报告生成器都不见了。

网站上只留下一条笼统的“我们正在重建，请耐心等待”的消息，互联网的反应一如既往——困惑、愤怒和阴谋论四起。Reddit 上甚至有理论认为，这是一场蓄意的“抽地毯”行动，旨在削弱免费网站，将用户推向付费产品。

三个月后，我与 The Numbers 的创始人兼首席执行官布鲁斯·纳什详细交谈了当时的情况。他描述了一段相当不愉快且多事之秋的经历：

我们收到了大量愤怒的邮件，人们质问道：‘你们以前有的那个页面现在去哪儿了？为什么没有了？’

在他的故事中，有许多事情值得每一个运营、依赖或仅仅是欣赏互联网的人警惕。

首先，一些背景信息

1997 年 10 月 17 日，星期五，数学家、前 IBM 软件开发人员布鲁斯·纳什在 Geocities 上发布了一个追踪 300 部电影的网站。

布鲁斯在一篇二十周年纪念文章中描述了这次发布（由于即将说明的原因，这篇文章现在仅存于互联网档案馆中）：

我在 Access 数据库中按下一个按钮，将一些 HTML 页面上传到 Geocities，并在好莱坞股票交易所的留言板上发布了一条简短公告，告诉大家我开始分析电影的票房数据，以帮助他们挑选在 HSX 上交易的 MovieStocks。

从这些不起眼的起点开始，布鲁斯和他围绕该网站组建的团队，将 The Numbers 打造成了电影行业最可靠的财务信息来源。

到 2026 年初，该数据库追踪了 78,396 部电影、178,375 条院线上映记录以及 236,176 位人物。

机器人来了

在其存续期间，The Numbers 所面临的挑战发生了巨大变化。在最初的二十五年左右，流量是可管理的，并且大多是有礼貌的。正如布鲁斯所说：

在 AI 出现之前，我们收到的是人类流量，大多是行为良好的搜索引擎爬虫，以及少数为个人项目爬取网站的人。如果有人过于贪婪，我们就能发现并封禁他们。

在过去几年里，世界各地的网站所有者都发现他们的网络流量发生了变化。最初只是人们浏览，后来让位于数量不断增长的机器人。到 2024 年，自动化流量已经超过了人类流量，就在上个月，Cloudflare 宣布机器人已占网页请求的 57.5%。

The Numbers 通过两波明显的浪潮感受到了这种变化。第一波大约始于 2024 年：

随着 AI 训练加入搜索引擎爬虫的行列，我们看到了爬取量的大幅增长。AI 爬虫的行为通常不如搜索引擎规范，这增加了我们为保持网站平稳运行所需的管理任务。

而第二波浪潮更猛烈，破坏性也更大：

大约在 2025 年 12 月，我们看到了另一次流量激增，我将此归因于智能体 AI：一方面是响应提示词而抓取网站的 AI 智能体，另一方面是人们能够编写抓取网站的智能体。

像每一个数据丰富的网站一样，到 2026 年初，The Numbers 正遭受着 AI 机器人以工业规模反复抓取其页面的猛烈冲击。布鲁斯表示，他们只有 10% 的流量来自浏览网站的人类，其余则来自 AI 机器人和自动化流量。

网站试图适应新的机器人

这给网站带来了巨大压力，但布鲁斯和他的团队能够采取措施来减轻最坏的影响。其中最巧妙的方法之一是用机器人自己的语言与它们对话：

网站上有些内容是为大语言模型设计的，目的是让它能告诉别人“这是你获取数据许可的方式”，而不是“这是你抓取网站的方式”。这产生了巨大效果。我们现在收到的许可咨询量大概是原来的十倍。

但缓解措施并不等于摆脱困境。从12月到3月初，团队一直在努力让网站在负载下保持运行。布鲁斯估计：

我们大约90%的时间都花在维持现有网站运行上，只能利用零碎时间开发新的改进系统。

问题因网站年代久远而雪上加霜：它已有三十年历史，大约有16万个源文件，服务于约200万个页面。

随后，在3月5日（周四）凌晨，服务器崩溃了。

团队手忙脚乱地试图弄清楚发生了什么，最初以为是AI流量过大所致。看起来确实是AI的责任……但可能并不完全是他们最初想的那样。

在大量智能体流量的掩盖下，网站日志显示了一些比数据抓取更严重的问题。正如布鲁斯所描述的：

其中一些访问者使用合法URL访问网站，另一些则在寻找后门，很可能是为了在数据出现在网站上之前就获取它，或者操纵呈现给用户的数据。

根据一位从事网络安全工作的朋友的建议，旧服务器被永久关闭了。恢复备份并让这个有三十年历史的网站重新上线，意味着要保护16万个遗留文件，抵御那些已经花了数月时间探测它们的攻击者。

团队在新基础设施上快速搭建了一个网站骨架版本，至少能在他们评估发生了什么以及下一步该怎么做期间，继续提供最新的票房数据。该版本于3月13日（周五）上线。

谁会想要私下访问一个票房网站呢？

乍一看，The Numbers 似乎不是一个明显的目标。它不收集信用卡信息，也没有可以在暗网上出售的诱人客户数据。它是一家小型独立公司，专门发布电影票房收入数据。

有人怎么能指望仅仅通过私下访问他们的网站来赚钱呢？

如果你还没猜到，这件事与预测市场有关。

Polymarket 在电影开画周末每周开设市场，并将 The Numbers 网站列为最终真相来源：

该电影在 The Numbers 页面上“票房”标签下的“每日票房表现”数据，将在三天开画周末的数值最终确定后，用于结算该市场。

任何一个周末市场的金额，按金融市场标准来看都不算大，通常在数万到数十万美元之间，而所有正在运行的票房市场在任何时刻的总金额约为数百万美元。

如果你能每周都比所有人更早看到 The Numbers 的数据，你就会比其他交易者拥有显著优势——在数据发布前略早获知答案，就能让你抢先交易。

在这种情况下，很难确切知道发生了什么。我们知道日志显示该网站被自动探测和抓取了数月，但最终导致网站瘫痪的原因以及是谁干的，仍然是个未解之谜。

但有人利用 AI 在预测市场中获得优势的理论是完全合理的。The Numbers 的经历向我们表明：

我们现在生活在一个电影统计网站值得被黑客攻击的世界，因为预测市场让任何人都能将几乎任何数据转化为金钱。

如今，任何人只需花很少的钱订阅 AI 就能实施网站黑客攻击。

面对大规模智能体 AI 机器人的集群攻击，当前的互联网极其脆弱。

那么，如今的黑客攻击到底有多容易？

2025 年 11 月，Anthropic（Claude 背后的 AI 实验室）发布了一份报告，称这是首次有记录的由 AI 策划的网络间谍活动。一个由国家支持的组织使用其编码工具攻击了大约 30 个组织，其中 AI 完成了 80% 到 90% 的工作，而人类在每个行动中仅介入 4 到 6 个决策点。

Anthropic 自己的结论是：

实施复杂网络攻击的门槛已大幅降低，我们预测这一趋势还将持续。

在更早的一份威胁报告中，Anthropic 说得更加明确：

缺乏技术技能的犯罪分子正在利用人工智能实施复杂的操作，例如开发勒索软件，而这些操作以往需要经过多年的培训才能完成。

与此同时，一款名为 XBOW 的自主人工智能渗透测试工具登上了 HackerOne 美国排行榜的榜首。该排行榜旨在对在真实公司中寻找安全漏洞以获取赏金的人员（此前全部为人类）进行排名，XBOW 在此过程中提交了近 1060 个漏洞。

访问一个拥有 16 万个遗留文件的三十年历史网站，正是人工智能工具已使其探测成本变得低廉的、存在已知缺陷的攻击面。曾经保护小型网站免受除最坚定攻击者之外所有人攻击的专业知识壁垒，在很大程度上已经消失了。

The Numbers 网站现在该怎么办？

布鲁斯和他的团队相对幸运。尽管整个网站一夜之间被攻陷，但他们仍能继续运营。The Numbers 一直免费使用，并且过去几年该网站并未严重依赖广告，因此这次宕机并未摧毁他们赖以生存的收入来源。

他们的核心业务与通过 OpusData 服务销售批量数据、为电影制作人和投资者制作票房分析报告以及发布《商业报告》相关联——所有这些业务均未受到公共网站瘫痪的影响。

但他们确实需要从头开始构建一个全新的网站，来托管那 78,396 部电影、178,375 条发行记录和 236,176 位人物。从备份中恢复网站并非可行之选，正如布鲁斯所指出的：

很明显，我们不能简单地重新上线那台服务器，因为它必然会再次被攻陷，可能就在几分钟之内。

这就是为什么该网站在三月中旬以极简形式恢复上线，并且功能是逐步而非一次性全部回归的原因。

目前，该团队不得不重新思考在 2026 年，一个公共网站究竟意味着什么。布鲁斯的分析是，The Numbers 过去服务于两类受众（人类和搜索引擎），而现在大约服务于六类：人类、搜索引擎、大语言模型训练运行、基于提示词的 AI 流量、智能体 AI 以及预测市场投机者。每一类都有不同的需求和不同的流量特征。正如他所说：

我们从一个运营网站只需关注三件事（内容、广告和 SEO）的世界，变成了每个设计决策都要考虑大约八到十个不同因素的局面。

他表示，目标是服务所有六类受众，为《商业报道》订阅用户提供新的 OpusData 服务和在线功能，更重要的是，帮助网站上的普通人类用户重新获取该网站一直提供的数据，其中部分数据将以全新且改进的形式呈现。

机器人爬取到底能有多糟糕？

说实话，相当糟糕。糟糕到像 Bruce 这样的网站所有者不得不质疑，花费如此多时间和金钱去构建和维护的东西，其价值究竟何在。

保护着全球大量网站的 Cloudflare 发布了一组数据，显示每个 AI 平台每为其爬取的网站回引一位访客，会爬取多少页面。

谷歌每为你回引一位访客，大约爬取 5 个页面。OpenAI 爬取超过 1000 个页面。Anthropic 每回引一位访客，爬取的页面超过 38,000 个。

请注意，该图表采用对数刻度，即底部的每一步都比前一步大十倍，否则这些差异实在太大，我无法在一张图表中展示。

纵观互联网至今的历史，开放网络的原则是：作为允许搜索引擎机器人读取你网站的回报，它们会为你带来读者。但现在，这种交换已不再适用。机器人的数量呈爆炸式增长，而且它们不再回引任何用户。

当这股洪流对准一个小型网站时，它可能会推高带宽费用，甚至可能让整个网站瘫痪。与 Bruce 经历相似的网站包括：

Read the Docs，一个为开源软件托管文档的非营利组织，他们发现一个爬虫在一个月内下载了 73 TB 的压缩 HTML 文件，导致其花费超过 5000 美元的带宽费用。

iFixit，这个维修指南数据库，在一天之内就记录了来自 Anthropic 爬虫的一百万次访问。

一家只有七名员工、销售 3D 扫描产品的公司 Triplegangers，在营业时间被 OpenAI 的爬虫攻击至离线，其 CEO 形容这“基本上就是一次 DDoS 攻击”。代码托管服务 SourceHut 的创始人报告称，他“每周要花 20% 到 100% 的时间”来对抗 AI 爬虫，导致“每周出现数十次短暂宕机”。

Linux 新闻网站 LWN 的编辑描述了来自“literally millions of IP addresses”的爬虫流量，并得出结论：“这是一次分布式拒绝服务攻击”。

当 GNOME 开源项目测量其流量时，发现大约 97% 的流量来自机器人。

一所大学图书馆在 48 小时内封禁了 16,000 个 IP 地址，以维持其目录系统的在线运行。

运营维基百科的维基媒体基金会在 2025 年 4 月报告称，机器人贡献了约 35% 的页面浏览量，但却占据了至少 65% 的最昂贵流量，因为爬虫会批量读取人类读者很少触及的冷门页面。

六个月后，挤压效应的另一半显现出来：维基百科的人类页面浏览量同比下降约 8%，因为人们越来越多地通过 AI 摘要获取维基百科的知识，而不再直接访问维基百科。机器正在以工业规模同时攫取内容和读者。

在公众中进行测试

AI 工具是人类创造过的最强大、也最具破坏性的工具之一。而它们正在现实世界中，由公众实时进行着有效的测试。当年曼哈顿计划想要测试原子技术的威力时，他们可不会每天早上把技术规格发给所有人，然后看哪栋房子被炸毁。

我们迄今为止所构建的世界，对我们所有人都能使用的 AI 模型的强大程度和规模，准备得极其不足。

我不希望这听起来像是一场片面的反 AI 恐惧宣传。AI 以及它能为人类做的事情，有很多值得喜欢的地方。但我们确实需要思考一下，我们正在踏入的是一个怎样的世界。

最先崩溃的是那些为旧互联网构建的东西。开放网络建立在一些假设之上，例如访问者大多是真人、流量大致反映读者数量、以及运营网站的成本与你从中获得的价值相关。如今，这些假设每一条都已过时。

一年前，Cloudflare 推出了按爬取付费模式，允许网站向 AI 爬虫按页面收费。上周，它更进一步，宣布了一种按使用量付费的模式，即当出版商的内容实际出现在 AI 回答中时，他们就能获得报酬；同时宣布，从 9 月 15 日起，其客户的广告支持页面将默认屏蔽未付费的“混合用途”爬虫。

这些措施能否奏效，取决于 AI 公司是选择配合，还是设法绕过。但正如 Bruce 对我所说，总得有人去尝试。

尾声

让我们暂且抛开具体细节，思考一下这里究竟发生了什么。

一个受人喜爱、实用且免费的网站，由一位能干、诚实的人精心运营了近三十年，却被新 AI 经济的两个特征压垮了。

不可持续的机器流量从上方猛烈冲击它，而很可能是一个受金钱驱使的入侵者，在一个入侵网站从未如此容易的世界里，将其彻底击垮。

Bruce 的事业和生计得以幸存，仅仅是因为这个网站并非他的全部业务。

其他人就没这么幸运了。就在上周，一家经营了 37 年的德国纺织公司 ZEGO，在 3 月份的一次网络攻击导致其生产中断六周后，申请了破产。与 The Numbers 不同，他们没有其他业务可以依靠。

网络上充斥着独立的档案库、爱好者的数据库、地方新闻网站、论坛、参考著作。数十年积累的人类努力，运行在陈旧的代码上，由小团队或个人维护，默默地支撑着我们共享知识中远比任何人所承认的要多得多的部分。

The Numbers 正在回归，并且比以往构建得更好。我鼓励你继续使用它，继续支持它，如果你也是众多因某个页面缺失而愤怒地给 Bruce 发邮件的用户之一，那么现在你知道了它缺失的原因，或许可以发一封更友善的邮件。
