Waarom AI en websites niet altijd goed met elkaar opschieten
Waarom robots.txt niet meer genoeg is – en wat er voor in de plaats komt
Laten we eerlijk zijn: het web heeft een probleem met crawlers, en het wordt er niet beter op.
Jarenlang werkten websites op basis van een onuitgesproken afspraak met zoekmachines. Wij lieten hun bots toe, en zij stuurden bezoekers terug. Het was niet officieel, maar het werkte. Je vriendelijke robots.txt was eigenlijk niet meer dan een vriendelijk briefje op de deur: "graag netjes blijven."
Die tijd gaat snel voorbij.
De bots winnen (en dat is niet positief bedoeld)
Geautomatiseerd verkeer beheerst inmiddels het internet. Onderzoekers die webverkeer analyseren, zien dat AI-crawlers en agents verantwoordelijk zijn voor het merendeel van de requests die grote CDN's bereiken. Hier is de ongemakkelijke waarheid:
- AI-platforms halen duizenden pagina's op voor elke bezoeker die ze naar een website sturen
- Het verzamelen van trainingsdata is de dominante vorm van webcrawling geworden
- Traditionele
robots.txtis hier nooit voor ontworpen – het kan identiteit niet verifiëren, doel niet specificeren, voorwaarden niet stellen of prijzen niet noemen
Stel je voor dat je een restaurant binnenloopt en er zitten 10.000 mensen gratis te eten omdat ze vaag beloofden dat ze misschien ooit een paar klanten zouden doorsturen.
Waarom robots.txt niet meer volstaat
Laten we eerst waarderen wat robots.txt werkelijk is: een vrijwillige, op goede trouw gebaseerde tekstfile die crawlers kunnen negeren. Zo bindend als een "rustig aan"-bordje bij een hardrockconcert.
De alternatieven van nu? Meestal proprietaire CDN-functies die je vastzetten aan specifieke aanbieders. Gebruik je geen Cloudflare, Akamai of welke enterprise-oplossing er vandaag populair is? Dan heb je pech.
Voor de onafhankelijke developer of startup die met eigen infrastructuur werkt, is er eigenlijk geen gestandaardiseerde manier om te onderhandelen met AI-systemen die je content opvragen.
Enter terms.txt: een slimmere handdruk
Onderzoekers hebben nu een nieuw voorstel gelanceerd (arXiv:2609.11152): terms.txt – beschouw het als robots.txt die volwassen is geworden en klaar voor de echte wereld.
Het kernidee: een machine-readable voorwaardenbestand dat websites naast hun content kunnen plaatsen, waarin ze kunnen aangeven:
- Wie er toegang krijgt (identiteitsverificatie via Web Bot Auth-handtekeningen)
- Waarom ze toegang krijgen (ondertekende intentieverklaringen)
- Wat ze mogen opvragen (regels per pad, per doel)
- Hoeveel (optioneel: HTTP 402-onderhandeling voor daadwerkelijke betaling)
Het systeem bevat delegatietokens zodat AI-agents namens developers kunnen handelen, ondertekende ontvangstbewijzen zodat websites daadwerkelijke toegang kunnen controleren, en cryptografische garanties afgedwongen via de origin-server.
De technische hoogtepunten
De schoonheid zit in de details:
- Geen externe afhankelijkheden: Voegt slechts 0,20 tot 0,65ms overhead toe op een single vCPU. Vrijwel onzichtbaar voor de meeste toepassingen.
- Geen vendor lock-in: In tegenstelling tot CDN-specifieke oplossingen werkt dit op origin-server-niveau.
- Gefaseerde complexiteit: Je kunt simpel beginnen (zoals robots.txt) en geavanceerde voorwaarden toevoegen wanneer nodig.
Waarom developers hiervan moeten weten
Als je AI-gestuurde tools bouwt, data scraped of een service runt die content van het web haalt, is dit om verschillende redenen belangrijk:
1. Compliance wordt gestandaardiseerd
In plaats van toegangsafspraken individueel te onderhandelen, stel je een wereld voor waarin sites simpelweg hun voorwaarden publiceren en jij ze cryptografisch ondertekent. Veel netter.
2. Nieuwe verdienmodellen ontstaan
HTTP 402 ("Payment Required") bestaat al jaren, maar had nooit infrastructuur ter ondersteuning. Nu kunnen websites daadwerkelijk betalen voor premium API-achtige toegang tot hun content – per-request microtransacties, wie wil dat niet?
3. Respect wordt verifiable
Voor ethische AI-bouwers biedt dit bewijs dat je sitevoorkeuren respecteert. Een cryptografisch ondertekende intentie om te voldoen is een stuk sterker dan "we beloven dat we robots.txt gelezen hebben."
De weg vooruit
Laten we onszelf niet voor de gek houden. Dit is een onderzoeksvoorstel, geen standaard. Adoptie vraagt om steun van grote AI-aanbieders, browserbouwers en de bredere developercommunity.
Maar de timing is goed. De informele scraping-economie van het web valt uiteen, rechtszaken over AI-trainingsdata vermenigvuldigen zich, en er is oprechte interesse in standaarden die geen enterprise CDN-contracten vereisen.
Bij NameOcean zien we dat infrastructuurdebatten zoals dit bepalen hoe het web zich ontwikkelt. Of je nu domeinen registreert, applicaties host, of de volgende generatie AI-tools bouwt – begrijpen wat er op protocolniveau speelt, helpt je te voorspellen waar het internet naartoe gaat.
De bots verdwijnen niet. De vraag is of we een fair systeem bouwen om hun toegang te beheren – of dat we blijven doen alsof een tekstbestand dat iedereen kan negeren voldoende is.
Wat denk jij? Is formele onderhandeling tussen websites en AI-systemen onvermijdelijk? Deel je gedachten hieronder.