Cloudflare 新出了个开关,叫“禁止 AI 训练”。这玩意儿能解个结:网站主不想让 AI 公司白嫖内容,但还得让 Google、Bing 这些搜索引擎正常来爬,保住排名。
技术上,Cloudflare 把爬虫分了类。一旦开启这个开关,混合爬虫(既用来搜又用来训练的)能进门,专门训练用的爬虫会被拦。Cloudflare 官方也提醒,拦太狠了,搜索引擎会以为你网站没多少内容或者进不去,SEO 分数跟着掉。
好在 Apple、Google、Microsoft 三家已经答应配合这个规则,保护用户隐私和网站权益。目前看来,现有的客户不用动,以前选“禁止训练”或者“有广告页禁止训练”的,系统自动会迁移到新规则里。
行业里其他家也在跟进。Google 准备几周内上线一个 URL 级别的透明化工具,能精确控制谁能抓。Apple 正在开发自家的工具。Microsoft 走得比较慢,计划要等到 2027 年初才支持通过 robots.txt 拒绝 AI 训练。
这背后的趋势挺明显,从早年那种直接 Block 所有 AI 爬虫的“一刀切”,变成了现在的精细控制。以前直接拦,搜索引擎跟不上了,网站流量就遭殃。现在这个方案是想平衡一下,既要被收录,又不想被免费复制。
大厂们这一波动作,本质上是在给 AI 公司设门槛。Google、Apple、Microsoft 联手,想堵住 AI 公司从网页上无偿收割数据的口子。特别是 Microsoft 那个 2027 年的计划,意味着未来三四年,robots.txt 文件得干两份活:既管搜索引擎爬虫,也管 AI 爬虫。
对 AI 厂商来说,这阵子能随便抓高质量网页的日子可能要到头了。成本会涨,难度会大。到时候,他们要么去找网站谈合作买数据,要么就得硬着头皮自己练原创能力,靠生成内容来补数据量的缺口。
