O Contrato Que Falta Entre Agentes de IA e a Web Aberta

O Contrato Que Falta Entre Agentes de IA e a Web Aberta

Set 12, 2026 ai web-protocols crawler-ethics developer-tools internet-standards dns web-hosting

O problema silencioso que está consumindo a internet

Vamos ser sinceros: a web tem um problema de crawling, e ele está piorando a cada dia.

Por décadas, sites funcionaram com base numa espécie de acordo cavalheiresco com os motores de busca. Deixávamos os robôs rastrearem nossas páginas, e eles nos enviavam visitantes de volta. Não era nada formal, mas funcionava. Aquele seu robots.txt amigável era basicamente um "por favor, seja educado" pregado na porta.

Essa era está acabando rapidamente.

Os Bots Estão Dominando (E Isso Não É Bom)

O tráfego automatizado hoje domina a internet. Pesquisadores que analisam padrões de tráfego nos principais CDNs apontam: crawlers e agentes de IA representam a maioria das requisições que chegam aos servidores.

A realidade incômoda é essa:

  • Plataformas de IA fazem a varredura de milhares de páginas para cada único visitante que devolvem a um site
  • A coleta de dados para treinamento se tornou a forma dominante de crawling na web
  • O bom e velho robots.txt nunca foi projetado para esse cenário — ele não consegue verificar identidade, definir propósito, estabelecer termos ou negociar preços

É como abrir um restaurante e encontrar 10 mil pessoas comendo de graça porque prometeram, vagamente, que talvez mandem alguns clientes algum dia.

Por que o robots.txt Não Resolve Mais

Vamos entender o que o robots.txt realmente é: um arquivo de texto voluntário, baseado no sistema de honra, que crawlers podem simplesmente ignorar. Tem o mesmo peso legal de uma placa de "zona silenciosa" num show de rock pesado.

E as alternativas mais novas? Na maioria, recursos proprietários de CDNs que te prendem a provedores específicos. Se você não está usando Cloudflare, Akamai ou alguma solução enterprise da vez, azar.

Para o desenvolvedor independente ou startup que roda sua própria infraestrutura, simplesmente não existe uma forma padronizada de negociar com sistemas de IA que acessam seu conteúdo.

Enter terms.txt: O Apertão de Mãos Inteligente

Uma proposta nova de pesquisadores do arXiv (arXiv:2609.11152) apresenta o terms.txt — pense nele como o robots.txt crescido e pronto para o mundo real.

A ideia central: um arquivo de termos legível por máquina que sites podem colocar junto ao seu conteúdo, expressando:

  • Quem está acessando (verificação de identidade via assinaturas Web Bot Auth)
  • Por que estão acessando (declarações de intenção assinadas)
  • O quê podem acessar (regras por caminho, por propósito)
  • Quanto custa (opcional: negociação via HTTP 402 para pagamento real)

O sistema inclui tokens de delegação para que agentes de IA ajam em nome dos desenvolvedores, recibos assinados para que sites auditem acessos reais, e garantias criptográficas aplicadas na origem.

Os Destaques Técnicos

A beleza está nos detalhes:

  • Implementação sem dependências: Adiciona apenas 0,20 a 0,65ms de overhead em uma única vCPU. Essencialmente imperceptível para a maioria dos casos.
  • Sem vendor lock-in: Ao contrário de soluções específicas de CDN, funciona no nível do servidor de origem.
  • Complexidade progressiva: Você pode começar simples (como o robots.txt) e adicionar termos sofisticados conforme a necessidade.

Por Que Desenvolvedores Devem se Importar

Se você está construindo ferramentas com IA, fazendo scraping de dados ou rodando qualquer serviço que puxa conteúdo da web, isso importa por várias razões:

1. Compliance fica padronizado

Em vez de negociar acordos de acesso um por um, imagine um mundo onde sites simplesmente publicam seus termos e você assina criptograficamente. Muito mais limpo.

2. Novos modelos de receita surgem

HTTP 402 ("Payment Required") existe há anos mas nunca teve infraestrutura para suportá-lo. Agora sites podem realmente cobrar por acesso premium estilo API — microtransações por requisição, alguém?

3. Respeito se torna verificável

Para construtores éticos de IA, isso oferece prova de que você está honrando as preferências do site. Uma intenção criptograficamente assinada de cumprir vale mais que "prometemos que lemos o robots.txt".

O Caminho pela Frente

Não vamos nos adiantar. Isso é uma proposta de pesquisa, não um padrão. A adoção exigiria buy-in de grandes provedores de IA, fabricantes de navegadores e a comunidade de desenvolvedores como um todo.

Mas o timing está certo. A economia informal de scraping da web está desmoronando, batalhas legais sobre dados de treinamento de IA estão se multiplicando, e há apetite genuíno por padrões que não exijam contratos de CDN enterprise.

Na NameOcean, vemos debates de infraestrutura como esse moldando como a web evolui. Seja você registrando domínios, hospedando aplicações ou construindo a próxima geração de ferramentas de IA, entender essas conversas em nível de protocolo ajuda a antecipar para onde a internet está indo.

Os bots não vão embora. A questão é se construímos um sistema justo para gerenciar o acesso deles — ou se continuamos fingindo que um arquivo de texto que todos podem ignorar é suficiente.

O que você acha? Negociação formal entre sites e sistemas de IA é inevitável? Deixe seus pensamentos aqui embaixo.

Read in other languages:

BG EL RU CS UZ FI TR SV HU RO PL IT NL FR NB DA ZH-HANS DE ES EN