Договор, которого нет: AI-агенты и открытый веб
Эпоха «джентльменских соглашений» в интернете подходит к концу
Давайте начистоту: у веба серьёзная проблема с краулингом, и становится только хуже.
Долгие годы сайты работали с поисковиками по принципу «ты — мне, я — тебе». Мы пускали их ботов на страницы, они приводили посетителей. Ничего формального, но работало. Ваш дружелюбный robots.txt — это была просто записка «будьте добры» на входной двери.
Те времена заканчиваются. Быстро.
Боты оккупировали сеть (и это плохо)
Автоматизированный трафик теперь доминирует в интернете. Исследователи, анализирующие паттерны веб-трафика, отмечают: AI-краулеры и агенты составляют большинство запросов к крупным CDN. Цифры не радуют:
- AI-платформы забирают тысячи страниц с каждого посетителя, которого они «возвращают» сайту
- Сбор данных для обучения стал основной формой веб-краулинга
- Привычный
robots.txtвообще не был рассчитан на такое — он не умеет проверять личность, определять цель, ставить условия или назначать цену
Это как открыть ресторан, а внутрь заваливаются 10 000 человек и едят бесплатно, потому что они «возможно, когда-нибудь» порекомендуют вас друзьям.
Почему robots.txt больше не работает
Оценим трезво: robots.txt — это добровольный текстовый файл, который краулеры могут просто игнорировать. Юридически он значит примерно столько же, сколько табличка «тихо» на рок-концерте.
Альтернативы? В основном проприетарные функции CDN, которые привязывают вас к конкретному провайдеру. Не используете Cloudflare, Akamai или очередное enterprise-решение? Значит, вам не повезло.
Для независимого разработчика или стартапа, который сам управляет инфраструктурой, стандартного способа договариваться с AI-системами просто не существует.
На сцену выходит terms.txt: умный протокол вместо рукопожатия
Исследователи с arXiv (arXiv:2609.11152) предложили terms.txt — эволюцию robots.txt для реального мира.
Суть проста: машиночитаемый файл с условиями, который сайты размещают рядом с контентом. В нём можно указать:
- Кто пришёл (верификация через Web Bot Auth подписи)
- Зачем пришёл (подписанные декларации намерений)
- Что можно забирать (правила для отдельных путей и целей)
- Сколько стоит (опционально: переговоры через HTTP 402)
Система включает делегационные токены, чтобы AI-агенты могли действовать от имени разработчиков, подписанные квитанции для аудита доступа и криптографические гарантии на уровне origin.
Технические детали
Идея хороша мелочами:
- Минимальная нагрузка: добавляет всего 0.20–0.65 мс задержки на одно ядро CPU. Практически незаметно.
- Без привязки к вендору: в отличие от CDN-решений, работает на уровне origin-сервера.
- Гибкая сложность: начинаете просто (как с robots.txt), а дальше добавляете правила по необходимости.
Почему это касается разработчиков
Если вы строите AI-инструменты, собираете данные или управляете сервисом, который забирает контент из сети, вот почему это важно:
1. Комплаенс становится стандартным
Вместо того чтобы договариваться с каждым сайтом отдельно, представьте мир, где площадки просто публикуют условия, а вы их криптографически подписываете. Чисто и прозрачно.
2. Появляются новые модели монетизации
HTTP 402 («Payment Required») существовал годами, но для него никогда не было инфраструктуры. Теперь сайты реально могут брать деньги за премиум-доступ к контенту — микротранзакции за каждый запрос?
3. «Уважение» становится подтверждаемым
Для этичных AI-разработчиков это даёт доказательство, что вы действительно соблюдаете правила площадок. Подписанное намерение следовать условиям — это не «мы клянемся, что прочитали robots.txt».
Что дальше
Не будем забегать вперёд. Это исследовательское предложение, а не стандарт. Для принятия нужно согласие крупных AI-провайдеров, браузерных компаний и всего сообщества.
Но момент подходящий. Неформальная экономика краулинга разваливается, судебные споры об авторских правах на обучающие данные множатся, и есть реальный запрос на стандарты, которые не требуют enterprise-CDN контрактов.
В NameOcean мы видим, как подобные инфраструктурные дискуссии определяют эволюцию веба. Регистрируете ли вы домены, хостите приложения или строите следующее поколение AI-инструментов — понимание этих протокольных разговоров помогает предвидеть, куда катится интернет.
Боты никуда не денутся. Вопрос в том, построим ли мы справедливую систему управления их доступом — или так и будем делать вид, что текстовый файл, который все могут игнорировать, это нормально.
А что думаете вы? Неизбежна ли формализация отношений между сайтами и AI-системами? Пишите в комментариях.