Cloudflare宣布升级AI爬虫管理功能,将自动化访问按照Search、Agent和Training三种用途分类。包括免费套餐在内的Cloudflare用户,都可以分别设置三类爬虫的访问权限,不再只能一键拦截全部AI机器人。
新默认规则将于2026年9月15日生效。届时,新接入Cloudflare的域名如果页面带有广告,将默认允许搜索爬虫,拦截Agent和模型训练爬虫。
1、Cloudflare将AI爬虫分为三类
| 分类 | 主要用途 | 对网站的影响 |
| Search | 抓取并索引网页,用于响应搜索请求 | 可能带来搜索展示和访问 |
| Agent | 根据用户指令实时访问网页、查询信息或执行操作 | 通常对应一次具体的用户任务 |
| Training | 抓取内容用于训练或微调AI模型 | 内容可能被用于模型能力建设 |
这套分类允许站长在保留搜索收录的同时,单独限制模型训练。例如,网站可以允许Search访问,同时拦截Training和不需要的Agent流量。
2、9月15日起调整默认设置
从2026年9月15日起,新接入Cloudflare的域名将在广告页面使用以下默认规则:
- Search搜索爬虫:允许;
- Agent代理爬虫:拦截;
- Training训练爬虫:拦截。
现有用户仍可自行选择是否采用新设置,并可以随时在Cloudflare安全设置中修改相关权限。
3、多用途爬虫可能被拦截
部分爬虫同时承担搜索索引和模型训练任务。新规则生效后,多用途爬虫会按照最严格的适用设置处理。
例如,网站允许Search但拦截Training,同时被标记为Search和Training的爬虫仍会被拦截。Cloudflare提到的多用途爬虫包括Googlebot、Applebot和Bingbot。
依靠Google或Bing获取流量的网站,建议在修改规则后检查搜索抓取和索引情况,避免影响正常收录。
4、Enterprise新增BotBase
Cloudflare还为Enterprise Bot Management用户推出BotBase机器人数据库。企业用户可以在控制面板中查询已识别的机器人,查看其用途分类、流量记录和检测ID。
除了Search、Agent和Training,BotBase还包括以下自动化行为:
- SEO抓取和网站审计;
- 广告展示验证;
- 价格及竞争数据采集;
- 漏洞扫描和安全测试;
- 社交平台链接预览;
- RSS及新闻内容抓取;
- 网站监控和健康检查;
- 代表用户执行结账等交易操作。
同一个机器人可以拥有多个分类,方便网站按照实际行为设置规则。
5、robots.txt新增内容使用信号
Cloudflare还在测试新的use内容使用信号,分为以下三个级别:
| 参数 | 允许范围 |
| use=immediate | 仅允许即时交互,不保存或重复使用内容 |
| use=reference | 允许索引、摘录并链接回原网站 |
| use=full | 允许总结和重新呈现内容 |
启用Cloudflare托管robots.txt后,规则将增加use=reference参数:
User-agent: * Content-Signal: search=yes,ai-train=no,use=reference Allow: /
这段内容表示允许搜索使用,不允许模型训练,同时允许爬虫索引、摘录并链接回原网站。该信号主要用于声明网站的内容使用偏好,不等于直接拦截,实际封锁仍需使用Cloudflare安全规则。
6、Cloudflare用户需要注意什么
使用Cloudflare的网站可以在2026年9月15日前检查AI机器人设置。内容站和依赖SEO流量的网站可以优先允许Search,再根据实际需要限制Agent和Training。
由于Googlebot、Applebot和Bingbot可能具有多种用途,不建议在没有观察抓取结果的情况下直接拦截全部相关流量。调整规则后,可以继续查看搜索引擎抓取状态、索引数量和来源流量,确认网站收录没有受到影响。
相关阅读:
《Cloudflare发布年度报告:Googlebot占据AI爬虫流量榜首》
(本文由美国主机侦探原创,转载请注明出处“美国主机侦探”和原文地址!)
微信扫码加好友进群
主机优惠码及时掌握
QQ群号:164393063
主机优惠发布与交流



