行业资讯

Cloudflare 推出拒绝 AI 训练爬虫新设置

Heooo 09月17日01时02分 15 阅读

「Cloudflare 推出 Disallow AI Training 设置,允许站长保留搜索引擎爬取、同时拒绝内容用于 AI 训练,苹果、谷歌和微软已承诺遵守。启用后仅标记为可问责的混合爬虫可抓取,其他 AI 训练爬虫仍被拦截,此前选择 Block 的网站将自动迁移。谷歌、苹果与微软也将陆续推出 URL 层级透明度工具。」

Cloudflare 宣布推出名为 “Disallow AI Training” 的新设置,允许网站管理员在继续接受搜索引擎爬取的同时,拒绝将网站内容用于 AI 训练。值得注意的是,苹果、谷歌和微软已承诺遵守该设置,这意味着这一选项将在主流搜索引擎与浏览器厂商层面获得实际支持。

按照 Cloudflare 的说明,管理员启用该设置后,用于搜索与 AI 训练的混合爬虫仍可抓取内容,但前提是系统将其标记为 “Accountable”,也就是可问责的爬虫;其他单纯用于 AI 训练的爬虫则会被拦截。官方同时提醒,拦截这类爬虫有可能影响网站的搜索排名,因此管理员需要在内容保护与搜索流量之间做出权衡。

在迁移策略上,Cloudflare 表示大多数客户无需进行任何更改:此前在 Training 选项中选择了 “Block” 或 “Block on pages with ads” 的网站,会自动迁移至 “Disallow AI Training”。这降低了站长重新配置的成本,也让既有的防护策略能够平滑延续下去。

围绕 URL 层级的透明度,几大厂商也在推进各自的工具。谷歌将在未来几周推出 Google-Extended 的 URL 层级透明度工具,苹果同样在开发自己的 URL 层级工具,微软则计划于 2027 年初支持通过 robots.txt 拒绝 AI 训练。

从开发者与站长生态的视角看,这一变化的意义在于把原本粗粒度的选择拆成了更细的维度:搜索引擎收录与 AI 训练数据采集不再被捆绑在同一个开关之下。对于依赖自然搜索流量、同时又希望保留内容价值的站点而言,这种区分提供了更灵活的配置空间;对于 AI 训练方而言,则意味着数据获取需要更明确地声明身份与用途,可问责机制正是其中的关键前提。

不过,该设置实际效果仍取决于爬虫方的配合程度。只有各方共同遵守声明,站长的选择才能真正落地;而各厂商在 URL 层级工具上的进度差异,也可能在一段时间内造成策略执行的参差不齐。对于内容站点来说,尽早规划自身的爬取与训练授权策略,或许比等待工具完全成熟更为务实。

# Cloudflare # AI训练数据 # 爬虫协议 # 搜索引擎

来源:Heooo AI工具导航