Agenții AI și web-ul deschis: de ce avem nevoie de un contract
Web-ul are o problemă cu bot-urile — iar terms.txt ar putea fi soluția
Să fim sinceri: internetul se confruntă cu o criză a crawl-erilor, iar lucrurile se agravează de la o zi la alta.
Timp de decenii, site-urile au funcționat pe baza unui acord informal cu motoarele de căutare. Le permiteam bot-urilor să acceseze paginile noastre, iar ele ne trimiteau vizitatori înapoi. Nu era nimic formal, dar funcționa. Fișierul tău robots.txt era, în esență, un bilet cu "vă rog frumos, fiți drăguți" lipit pe ușă.
Acea eră se termină rapid.
Bot-urile au luat controlul (și nu e o veste bună)
Traficul automat a devenit stăpânul internetului. Conform cercetătorilor care analizează tiparele de trafic web, crawl-erii și agenții AI reprezintă acum majoritatea cererilor care ajung la CDN-urile majore. Iată realitatea:
- Platformele AI preiau mii de pagini pentru fiecare singur vizitator pe care îl trimit înapoi către un site
- Colectarea datelor de antrenare a devenit forma dominantă de crawling web
robots.txttradițional nu a fost niciodată creat pentru această lume — nu poate verifica identitatea, nu poate defini scopul, nu poate stabili termeni și nu poate seta prețuri
E ca și cum ai intra într-un restaurant și ai găsi 10.000 de oameni mâncând gratis pentru că au promis vag că poate vor trimite câțiva clienți în viitor.
De ce robots.txt nu mai face față
Să apreciem ce este de fapt robots.txt: un fișier text voluntar, bazat pe încredere, pe care crawl-erii pot să îl ignore. Are aceeași forță legală ca un semn de "zonă liniștită" la un concert rock zgomotos.
Alternativele mai noi? În mare parte, funcții proprietare de CDN care te blochează în furnizori specifici. Dacă nu folosești Cloudflare, Akamai sau altă soluție enterprise la modă, ești lipsit de opțiuni.
Pentru dezvoltatorul independent sau startup-ul care își rulează propria infrastructură, nu există practic nicio metodă standardizată de a negocia cu sistemele AI care accesează conținutul tău.
Intrare terms.txt: O strângere de mână mai inteligentă
O nouă propunere din partea cercetătorilor de la arXiv (arXiv:2609.11152) introduce terms.txt — gândește-te la el ca la robots.txt maturizat și pregătit pentru lumea reală.
Ideea de bază: un fișier cu termeni care poate fi citit de mașini, pe care site-urile îl pot plasa alături de conținutul lor, exprimând:
- Cine accesează (verificare a identității prin semnături Web Bot Auth)
- De ce accesează (declarații de intent semnate)
- Ce pot accesa (reguli per-path, per-scop)
- Cât de mult (opțional: negociere HTTP 402 pentru plată efectivă)
Sistemul include token-uri de delegare astfel încât agenții AI să poată acționa în numele dezvoltatorilor, chitanțe semnate pentru ca site-urile să poată audita accesul real, și garanții criptografice impuse la origine.
Detaliile tehnice
Frumusețea stă în detalii:
- Implementare fără dependențe: Adaugă doar 0.20-0.65ms overhead pe un singur vCPU. Practic invizibil pentru majoritatea cazurilor de utilizare.
- Fără vendor lock-in: Spre deosebire de soluțiile specifice CDN, funcționează la nivel de server origin.
- Complexitate progresivă: Poți începe simplu (ca
robots.txt) și adăuga termeni sofisticați pe măsură ce ai nevoie.
De ce ar trebui să le pese dezvoltatorilor
Dacă construiești instrumente alimentate de AI, colectezi date sau rulezi orice serviciu care preia conținut de pe web, acest lucru contează din mai multe motive:
1. Conformitatea devine standardizată
În loc să negociezi acorduri de acces unul câte unul, imaginează-ți o lume în care site-urile publică pur și simplu termenii lor și tu îi semnezi criptografic. Mult mai curat.
2. Apar noi modele de venituri
HTTP 402 ("Payment Required") există de ani de zile, dar nu a avut niciodată infrastructura necesară pentru a fi funcțional. Acum site-urile pot taxa efectiv accesul premium de tip API la conținutul lor — micro-tranzacții per cerere, cine e interesat?
3. Respectul devine verificabil
Pentru constructorii de AI etici, acest lucru oferă dovada că onorezi preferințele site-urilor. O intenție de conformitate semnată criptografic bate "promitem că am citit robots.txt".
Drumul înainte
Să nu ne grăbim. Aceasta este o propunere de cercetare, nu un standard. Adoptarea ar necesita suport din partea furnizorilor majori de AI, producătorilor de browsere și comunității mai largi de dezvoltatori.
Dar momentul este potrivit. Economia informală de scraping a web-ului se prăbușește, disputele legale privind datele de antrenare AI se înmulțesc, și există o dorință reală de standarde care nu necesită contracte enterprise cu CDN-uri.
La NameOcean, observăm că dezbaterile de infrastructură ca aceasta modelează felul în care evoluează web-ul. Fie că înregistrezi domenii, găzduiești aplicații sau construiești următoarea generație de instrumente AI, înțelegerea acestor conversații la nivel de protocoale te ajută să anticipezi încotro se îndreaptă internetul.
Bot-urile nu vor dispărea. Întrebarea este dacă construim un sistem echitabil pentru gestionarea accesului lor — sau continuăm să pretindem că un fișier text pe care toată lumea îl poate ignora este suficient.
Ce părere ai? Este negocierea formală între site-uri și sistemele AI inevitabilă? Scrie-ne mai jos.