El contrato pendiente entre los agentes de IA y la web abierta

El contrato pendiente entre los agentes de IA y la web abierta

Sep 12, 2026 ai web-protocols crawler-ethics developer-tools internet-standards dns web-hosting

El fin del acuerdo silencioso: por qué terms.txt podría reemplazar a robots.txt

Vamos a ser directos: la web tiene un problema con los crawlers, y está empeorando.

Durante décadas, los sitios web operaron bajo un acuerdo tácito con los motores de búsqueda. Les dejábamos rastrear nuestras páginas y ellos nos enviaban visitantes. No era nada formal, pero funcionaba. Tu amigable archivo robots.txt era básicamente una nota de "por favor, sé amable" pegada en la puerta.

Esa época se está acabando rápidamente.

Los bots están ganando... y no es algo bueno

El tráfico automatizado ahora domina internet. Según investigadores que analysan patrones de tráfico web, los crawlers y agentes de IA representan la mayoría de las peticiones que llegan a los principales CDNs. Aquí está la realidad incómoda:

  • Las plataformas de IArecuperan miles de páginas por cada visitante que devuelven a un sitio web
  • La recolección de datos para entrenamiento se ha convertido en la forma dominante de rastreo web
  • El robots.txt tradicional nunca fue diseñado para este mundo: no puede verificar identidades, especificar propósitos, definir condiciones ni establecer precios

Es como llegar a un restaurante y encontrar 10.000 personas comiendo gratis porque prometieron vagamente que quizás algún día te envíen algunos clientes.

Por qué robots.txt ya no es suficiente

Apreciemos lo que robots.txt realmente es: un archivo de texto voluntario, basado en el honor, que los crawlers pueden ignorar. Tiene la misma fuerza legal que un letrero de "zona silenciosa" en un concierto de rock.

¿Las alternativas más nuevas? Principalmente funciones propietarias de CDNs que te encadenan a proveedores específicos. Si no estás usando Cloudflare, Akamai o la solución empresarial de moda, no tienes suerte.

Para el desarrollador independiente o la startup que maneja su propia infraestructura, básicamente no existe una forma estandarizada de negociar con los sistemas de IA que acceden a tu contenido.

Conoce terms.txt: un apretón de manos más inteligente

Una nueva propuesta de investigadores en arXiv (arXiv:2609.11152) presenta terms.txt: piensa en ella como robots.txt grown up y lista para el mundo real.

La idea central: un archivo de términos legible por máquinas que los sitios web pueden colocar junto a su contenido, expresando:

  • Quién está accediendo (verificación de identidad mediante firmas Web Bot Auth)
  • Por qué están accediendo (declaraciones de intención firmadas)
  • Qué pueden acceder (reglas por ruta y por propósito)
  • Cuánto (opcional: negociación HTTP 402 para pago real)

El sistema incluye tokens de delegación para que los agentes de IAactúen en nombre de los desarrolladores, recibos firmados para que los sitios puedan auditar el acceso real, y garantías criptográficas aplicadas en el origen.

Los detalles técnicos

La belleza está en los detalles:

  • Implementación sin dependencias: Añade solo entre 0.20 y 0.65ms de sobrecarga en un solo vCPU. Es prácticamente invisible para la mayoría de usos.
  • Sin bloqueo de proveedores: A diferencia de las soluciones específicas de CDNs, esto funciona a nivel de servidor de origen.
  • Complejidad gradual: Puedes empezar de forma simple (como robots.txt) y añadir términos sofisticados según necesites.

Por qué los desarrolladores deberían prestar atención

Si estás construyendo herramientas con IA, raspando datos o ejecutando cualquier servicio que extraiga contenido de la web, esto importa por varias razones:

1. El cumplimiento se estandariza

En lugar de negociar acuerdos de acceso uno por uno, imagina un mundo donde los sitios simplemente publican sus términos y tú los firmas criptográficamente. Mucho más limpio.

2. Aparecen nuevos modelos de ingresos

HTTP 402 ("Payment Required") ha existido durante años pero nunca tuvo infraestructura para soportarlo. Ahora los sitios web pueden cobrar realmente por acceso premium estilo API a su contenido: ¿microtransacciones por petición, alguien?

3. El respeto se vuelve verificable

Para los constructores éticos de IA, esto proporciona prueba de que estás respetando las preferencias de los sitios. Una intención criptográficamente firmada de cumplir supera a "prometemos que leímos robots.txt".

El camino por delante

No nos adelantemos. Esto es una propuesta de investigación, no un estándar. La adopción requeriría apoyo de los principales proveedores de IA, fabricantes de navegadores y la comunidad de desarrolladores en general.

Pero el momento es el adecuado. La economía informal de raspado de la web se está desmoronando, las batallas legales sobre datos de entrenamiento de IA se multiplican, y hay un hambre genuina por estándares que no requieran contratos empresariales de CDN.

En NameOcean, vemos cómo debates de infraestructura como este moldean cómo evoluciona la web. Ya sea que estés registrando domains, hospedando aplicaciones o construyendo la próxima generación de herramientas de IA, entender estas conversaciones a nivel de protocolo te ayuda a anticipar hacia dónde se dirige internet.

Los bots no van a desaparecer. La pregunta es si construimos un sistema justo para gestionar su acceso, o seguimos fingiendo que un archivo de texto que todos pueden ignorar es suficiente.

¿Qué opinas? ¿Es inevitable la negociación formal entre sitios web y sistemas de IA? Comparte tu pensamiento aquí abajo.

Read in other languages:

BG EL RU CS UZ FI TR SV HU RO PT PL IT NL FR NB DA ZH-HANS DE EN