Договор, которого нет: AI-агенты и открытый веб

Договор, которого нет: AI-агенты и открытый веб

Сен 12, 2026 ai web-protocols crawler-ethics developer-tools internet-standards dns web-hosting

Эпоха «джентльменских соглашений» в интернете подходит к концу

Давайте начистоту: у веба серьёзная проблема с краулингом, и становится только хуже.

Долгие годы сайты работали с поисковиками по принципу «ты — мне, я — тебе». Мы пускали их ботов на страницы, они приводили посетителей. Ничего формального, но работало. Ваш дружелюбный robots.txt — это была просто записка «будьте добры» на входной двери.

Те времена заканчиваются. Быстро.

Боты оккупировали сеть (и это плохо)

Автоматизированный трафик теперь доминирует в интернете. Исследователи, анализирующие паттерны веб-трафика, отмечают: AI-краулеры и агенты составляют большинство запросов к крупным CDN. Цифры не радуют:

  • AI-платформы забирают тысячи страниц с каждого посетителя, которого они «возвращают» сайту
  • Сбор данных для обучения стал основной формой веб-краулинга
  • Привычный robots.txt вообще не был рассчитан на такое — он не умеет проверять личность, определять цель, ставить условия или назначать цену

Это как открыть ресторан, а внутрь заваливаются 10 000 человек и едят бесплатно, потому что они «возможно, когда-нибудь» порекомендуют вас друзьям.

Почему robots.txt больше не работает

Оценим трезво: robots.txt — это добровольный текстовый файл, который краулеры могут просто игнорировать. Юридически он значит примерно столько же, сколько табличка «тихо» на рок-концерте.

Альтернативы? В основном проприетарные функции CDN, которые привязывают вас к конкретному провайдеру. Не используете Cloudflare, Akamai или очередное enterprise-решение? Значит, вам не повезло.

Для независимого разработчика или стартапа, который сам управляет инфраструктурой, стандартного способа договариваться с AI-системами просто не существует.

На сцену выходит terms.txt: умный протокол вместо рукопожатия

Исследователи с arXiv (arXiv:2609.11152) предложили terms.txt — эволюцию robots.txt для реального мира.

Суть проста: машиночитаемый файл с условиями, который сайты размещают рядом с контентом. В нём можно указать:

  • Кто пришёл (верификация через Web Bot Auth подписи)
  • Зачем пришёл (подписанные декларации намерений)
  • Что можно забирать (правила для отдельных путей и целей)
  • Сколько стоит (опционально: переговоры через HTTP 402)

Система включает делегационные токены, чтобы AI-агенты могли действовать от имени разработчиков, подписанные квитанции для аудита доступа и криптографические гарантии на уровне origin.

Технические детали

Идея хороша мелочами:

  • Минимальная нагрузка: добавляет всего 0.20–0.65 мс задержки на одно ядро CPU. Практически незаметно.
  • Без привязки к вендору: в отличие от CDN-решений, работает на уровне origin-сервера.
  • Гибкая сложность: начинаете просто (как с robots.txt), а дальше добавляете правила по необходимости.

Почему это касается разработчиков

Если вы строите AI-инструменты, собираете данные или управляете сервисом, который забирает контент из сети, вот почему это важно:

1. Комплаенс становится стандартным

Вместо того чтобы договариваться с каждым сайтом отдельно, представьте мир, где площадки просто публикуют условия, а вы их криптографически подписываете. Чисто и прозрачно.

2. Появляются новые модели монетизации

HTTP 402 («Payment Required») существовал годами, но для него никогда не было инфраструктуры. Теперь сайты реально могут брать деньги за премиум-доступ к контенту — микротранзакции за каждый запрос?

3. «Уважение» становится подтверждаемым

Для этичных AI-разработчиков это даёт доказательство, что вы действительно соблюдаете правила площадок. Подписанное намерение следовать условиям — это не «мы клянемся, что прочитали robots.txt».

Что дальше

Не будем забегать вперёд. Это исследовательское предложение, а не стандарт. Для принятия нужно согласие крупных AI-провайдеров, браузерных компаний и всего сообщества.

Но момент подходящий. Неформальная экономика краулинга разваливается, судебные споры об авторских правах на обучающие данные множатся, и есть реальный запрос на стандарты, которые не требуют enterprise-CDN контрактов.

В NameOcean мы видим, как подобные инфраструктурные дискуссии определяют эволюцию веба. Регистрируете ли вы домены, хостите приложения или строите следующее поколение AI-инструментов — понимание этих протокольных разговоров помогает предвидеть, куда катится интернет.

Боты никуда не денутся. Вопрос в том, построим ли мы справедливую систему управления их доступом — или так и будем делать вид, что текстовый файл, который все могут игнорировать, это нормально.

А что думаете вы? Неизбежна ли формализация отношений между сайтами и AI-системами? Пишите в комментариях.

Read in other languages:

BG EL CS UZ FI TR SV HU RO PT PL IT NL FR NB DA ZH-HANS DE ES EN