AI智能体与开放网络:缺失的那份"协议

AI智能体与开放网络:缺失的那份"协议

九月 12, 2026 ai web-protocols crawler-ethics developer-tools internet-standards dns web-hosting

网站和AI爬虫之间的"君子协定"要结束了?

说实话,互联网上爬虫的问题越来越严重了。

以前,网站和搜索引擎之间有个不成文的约定:让它们的爬虫来抓我们的内容,作为交换,它们会给我们带点流量回来。没签什么合同,但一直这么运转着。robots.txt文件说白了就是个"请高抬贵手"的小纸条,贴在大门上意思意思。

但这套玩法快行不通了。

爬虫越来越过分——而且不是往好的方向

现在自动化流量已经占据了互联网的大半江山。有研究人员分析了网络流量数据,发现AI爬虫和代理程序在主要CDN的请求中已经超过了传统用户流量。现实挺让人头疼的:

  • AI平台每给网站带来1个访客,就会抓走几千个页面
  • 爬数据拿来训练AI,已经成了网上爬虫活动的主流目的
  • 传统robots.txt压根儿没设计来处理这种情况——它不能验证身份、不能说明目的、不能谈条件、更不能定价

打个比方:你开了家餐厅,结果门口来了10000个人说要免费吃,理由是他们"也许"以后会给你介绍几个客人。

为什么robots.txt已经不敷使用了

先说说robots.txt到底是个什么东西:它就是个自愿遵守的、靠自觉的文本文件,爬虫可以选择不听。就跟在摇滚演唱会现场立个"请保持安静"的牌子一样——基本没什么用。

现在那些新方案呢?大多是各家CDN自己搞的私有功能。用Cloudflare、Akamai这些平台还行,但如果你不在他们上面,就别想用这些功能。

对于自己架服务器的个人开发者或者创业团队来说,你想跟抓你内容的AI系统"讲条件",基本上找不到任何标准化的方式。

terms.txt来了:聪明人的握手方式

arXiv上有篇新论文(编号arXiv:2609.11152),提出一个新方案叫terms.txt——你可以理解为robots.txt的成年进化版。

核心理念是:网站可以放一个机器可读的条款文件,让来访的AI系统知道:

  • 在访问(通过Web Bot Auth签名验证身份)
  • 为什么要访问(签署的意图声明)
  • 能访问什么(按路径、按用途设置规则)
  • 要付多少钱(可选的HTTP 402支付协商)

系统还支持委托令牌,让AI代理可以代表开发者行事;签署的收据让网站能审计真实的访问情况;来源端加密保证,不可抵赖。

技术亮点

方案的设计细节挺有意思:

  • 零依赖实现:单核CPU增加的开销只有0.20到0.65毫秒,基本上感知不到
  • 不绑平台:不像CDN专有方案,这个在源站层面就能用
  • 复杂度可逐步升级:起步可以很简单,像robots.txt那样;需要的时候再加上复杂的条款

为什么开发者应该关注

如果你在做AI工具、爬数据、或者提供任何从网上抓内容的的服务,这个方案跟你有关系:

1. 合规变得标准化了

以前要一个个网站去谈访问协议。以后网站直接公布条款,你加密签名同意就行——清爽多了。

2. 新的变现模式出现了

HTTP 402("需要支付")这个状态码存在好多年了,但一直没有配套基础设施支持。现在网站可以真正对内容访问收费了——按请求的微交易,想想就刺激。

3. "我很守规矩"可以验证了

对于想认真做AI的人来说,这提供了证明你尊重网站意愿的方式。加密签名的合规承诺,总比"我们保证读了robots.txt"有说服力吧。

接下来会怎样

先别急着欢呼。这只是个研究提案,还没成为标准。真要推广开来,需要各大AI厂商、浏览器开发商、整个开发者社区都点头。

但时机确实到了。网上那种"随便爬"的默契正在瓦解,AI训练数据的法律纠纷越来越多,大家也确实想要一个不用签企业CDN合同就能用的标准。

在NameOcean,我们一直关注这类基础设施层面的讨论——它们会决定互联网往哪个方向走。不管你是在注册domain、做hosting,还是在开发下一代AI工具,了解这些协议层面的进展,能帮你提前判断互联网的走向。

爬虫不会消失。问题是我们能不能建立一套公平的系统来管理它们的访问——还是继续假装那个谁都可以不理的文本文件够用。

你怎么看?网站和AI系统之间的正式协商是不是迟早的事?评论区聊聊。

Read in other languages:

BG EL RU CS UZ FI TR SV HU RO PT PL IT NL FR NB DA DE ES EN