Cloudflare宣布推出针对AI爬虫的“负责任(Accountable)”认证体系,并同步上线“禁止AI训练(Disallow AI Training)”设置。该功能允许网站所有者在保留搜索引擎索引访问权限的同时,拒绝将其内容用于AI模型训练,从而解决多用途爬虫带来的权益两难困境。

细化控制权,取代单一开关

数据显示,兼具搜索索引与AI训练功能的多用途爬虫,目前占Cloudflare网络上已验证爬虫流量的36.6%。此前,网站所有者往往需要在“允许AI训练”与“完全阻止爬虫(导致失去搜索曝光)”之间做出二选一的决定。统计显示,仅不到1%的网站所有者会阻止搜索爬虫,而17%限制了AI训练。

为此,Cloudflare用三个独立的控件取代了原有的“阻止AI机器人(Block AI Bots)”单一开关,分别用于控制搜索爬取、AI训练以及AI代理活动。公司还根据商业模式提供推荐设置:对于含广告网站,建议允许搜索、禁止AI训练并阻止AI代理;其他类型网站则建议全面开放。

此外,Cloudflare以“Bot Preference Sync(机器人偏好同步)”功能取代了“Managed Robots.txt”。网站所有者可一次性设置爬取偏好,并自动同步至支持的爬虫,且可随时更改。

确立“负责任”四大标准

Cloudflare为获得“负责任”认证的爬虫运营商确立了四项标准:通过robots.txt或同等机制提供退出AI训练的途径;提供退出AI生成搜索摘要的途径;提供URL级别的可见性,展示内容如何被用于搜索和训练;公开承诺退出训练不会影响传统搜索结果排名。

目前,Apple、Google和Microsoft均被标记为“负责任”。Cloudflare指出,这些巨头要么已证明符合上述标准,要么提供了具体的合规时间表。例如,Google提供的Google-Extended功能允许网站在不退出搜索的情况下选择退出AI训练;而其他主要AI公司则为搜索和训练运行独立的爬虫,使得Cloudflare能在不影响搜索的前提下单独阻断其训练行为。

Cloudflare联合创始人兼CEO Matthew Prince表示,此举旨在保持互联网开放性的同时,赋予内容创作者对其作品使用方式的切实控制权。公司将在Cloudflare Radar上公布所有符合条件的运营商完整名单。

推动标准化与未来规划

在行业标准方面,Cloudflare参与了互联网工程任务组(IETF)关于ai-prefs规范的开放标准工作,旨在帮助网站以标准化、可移植的方式表达AI访问偏好。

针对AI生成摘要的控制,目前尚为针对每个运营商单独设置的“是/否”选项。Cloudflare表示,到明年初,公司将致力于让网站所有者能够在一个统一界面中,精细控制有多少内容被纳入AI生成的摘要中。