Cloudflare 刚刚为 AI 行业设定了一个新的截止日期,要求将用于传统搜索目的(如 Google 搜索)的网络爬虫与用于 AI 智能体和训练的爬虫区分开来。该公司周三宣布,从 2026 年 9 月 15 日起,Cloudflare 的默认设置将阻止“混合用途”爬虫访问任何托管广告的页面。
这意味着,融合了搜索、智能体使用和训练的爬虫将默认被禁止爬取这些网站,除非网站所有者另行调整设置。该公司表示,这些默认设置的变更将适用于新的 Cloudflare 客户、现有客户建立的新网站,以及所有现有的免费客户。
此举可能会影响 AI 模型提供商获取网络内容以用于训练和驱动其智能体服务的能力。
Cloudflare 指出,大多数网站所有者希望自己的内容能通过搜索被发现,通常也希望通过 AI 服务被发现,但他们希望保护自己的知识产权不被免费赠送。
Cloudflare 特别指出,“全球最大的搜索引擎”(显然是指 Google!)能够获取“大约两倍于”其他 AI 公司的信息,因为这家搜索巨头让客户很难在不被用于 AI 的情况下保持可发现性。
Google 过去曾反驳过这种概括性说法,指出它提供了一个名为 Google Extended 的爬虫,允许网站所有者选择不让自己的内容用于训练以及 Gemini 应用和 Vertex API 等 AI 产品和服务。使用该爬虫不会影响网站在 Google 搜索中的收录。然而,这家科技巨头的旗舰产品 Googlebot 会为搜索进行爬取,包括 AI 概览和 AI 模式等 AI 功能。
“既然互联网上的大部分流量已是非人类流量,我们必须更进一步、行动更快,以便一个可持续的生态系统能够出现,”Cloudflare 联合创始人兼首席执行官 Matthew Prince 在宣布这一消息时表示,他指的是最近机器人流量首次超过人类在线流量的里程碑。这一转变原本预计要到明年才会发生。
“Cloudflare 的新工具和合作伙伴关系为网站所有者提供了更高的可见性和商业机会,也使那些拥有明确透明意图的机器人的 AI 公司受益。我们希望我们提出的默认设置变更能鼓励混合用途爬虫将搜索用途与智能体用途和训练用途区分开来,”Prince 表示。
虽然 Cloudflare 提供了许多产品来帮助用户启动自己的 AI 系统,但该公司也发布了一系列工具,让发布商在 AI 时代对其内容拥有更多控制权。近年来,Cloudflare 推出了打击 AI 机器人的工具,包括一个允许网站向 AI 机器人收取抓取费用的市场,名为“按爬取付费”。
该公司表示,后者现在也正在演变为“按使用付费”,这将允许发布商在其内容创造价值时(而不仅仅是被获取时)向 AI 公司收费。
这一变化也有助于节省发布商的带宽和 AI 模型提供商的算力资源,因为 Cloudflare 的数据表明,AI 爬虫超过 50% 的爬取流量都用于重新获取未更改的页面。
为了将这一方案付诸实施,Cloudflare 最初与两家合作伙伴 Ceramic.ai 和 You.com 合作。当发布商选择加入后,如果其内容出现在 Ceramic 的 AI 搜索结果中,或者当 You.com 访问其部分付费内容时,发布商将获得报酬。
Cloudflare 表示,其他 AI 公司可以根据自身工作方式定制此模式。