AI a web: Souboj o pravidla, která nikdo nenapsal

AI a web: Souboj o pravidla, která nikdo nenapsal

Zář 12, 2026 ai web-protocols crawler-ethics developer-tools internet-standards dns web-hosting

Botsy ovládly internet. Soubor robots.txt už nestačí

Pojďme si to přiznat: web má problém s procházením a je čím dál tím horší.

Desítky let fungovaly webové stránky na bázi gentlemanské dohody se search enginy. My jsme nechali jejich boty procházet naše stránky, oni nám posílali návštěvníky. Žádná velká formalita, ale fungovalo to. Váš přátelský soubor robots.txt byl v podstatě lístek s nápisem „prosím, chovejte se slušně" připevněný na dveře.

Ta éra končí. Rychle.

Když boti vyhrávají (a není to nic dobrého)

Automatizovaný provoz dnes dominuje internetu. Podle výzkumníků, kteří analyzují vzorce webového trafficu, tvoří AI crawlboti a agenti většinu požadavků mířících na velké CDN sítě. Tady je ta nepříjemná realita:

  • AI platformy stahují tisíce stránek pro každého jednoho návštěvníka, kterého webu pošlou
  • Sběr trénovacích dat se stal dominantní formou webového crawlování
  • Tradiční robots.txt nikdy nebyl pro tento svět navržen — nedokáže ověřit identitu, specifikovat účel, definovat podmínky ani stanovit ceny

Je to jako přijít do restaurace a zjistit, že tam jí zadarmo 10 000 lidí, protože nějak vágně slíbili, že možná někdy pošlou pár zákazníků.

Proč robots.txt už nestačí

Ocmeňme si, co robots.txt vlastně je: dobrovolný soubor fungující na principu čestného slova, který crawlboti mohou ignorovat. Je to zhruba tak právně závazné jako cedulka „tichá zóna" uprostřed hlučného rockového koncertu.

Ty novější alternativy? Většinou proprietární CDN funkce, které vás zavřou k určitému poskytovateli. Pokud zrovna nepoužíváte Cloudflare, Akamai nebo jiný enterprise mainstream řešení, máte smůlu.

Pro nezávislého developera nebo startup běžící na vlastní infrastruktuře nemáte prakticky žádný standardizovaný způsob, jak vyjednávat s AI systémy přistupujícími k vašemu obsahu.

Vstupuje terms.txt: Chytřejší handshake

Nový návrh od výzkumníků z arXiv (arXiv:2609.11152) představuje terms.txt — představte si to jako robots.txt, které vyrostlo a je připravené na reálný svět.

Základní myšlenka: strojově čitelný soubor s podmínkami, který mohou weby umístit vedle svého obsahu a vyjádřit v něm:

  • Kdo přistupuje (ověření identity přes Web Bot Auth podpisy)
  • Proč přistupuje (podepsané deklarace záměru)
  • Co může přistupovat (pravidla per-cesta, per-účel)
  • Kolik (volitelně: HTTP 402 vyjednávání pro skutečnou platbu)

Systém zahrnuje delegovací tokeny, takže AI agenti mohou jednat jménem developerů, podepsané potvrzenky pro audit skutečného přístupu a kryptografické záruky vynucované na origin serveru.

Technické detaily

Krása je v detailech:

  • Implementace bez závislostí: Přidává pouze 0.20 až 0.65ms režii na jednom vCPU. To je pro většinu nasazení prakticky nepostřehnutelné.
  • Žádný vendor lock-in: Na rozdíl od CDN-specifických řešení funguje na úrovni origin serveru.
  • Graduovaná složitost: Můžete začít jednoduše (jako s robots.txt) a přidávat sofistikované podmínky podle potřeby.

Proč by se měli developeři zajímat

Pokud stavíte AI-powered nástroje, scrapujete data nebo provozujete jakoukoli službu, která tahá obsah z webu, mělo by vás to zajímat z několika důvodů:

1. Compliance se standardizuje

Místo vyjednávání přístupových dohod jednu po druhé si představte svět, kde weby jednoduše publikují své podmínky a vy je kryptograficky podepíšete. Mnohem čistší.

2. Objevují se nové obchodní modely

HTTP 402 („Payment Required") existuje roky, ale nikdy neměl infrastrukturu na podporu. Teď mohou weby skutečně účtovat premium přístup k API-style obsahu — mikrotransakce per-request, kdokoli?

3. Respekt se dá ověřit

Pro etické stavitele AI to poskytuje důkaz, že ctíte preference stránek. Kryptograficky podepsaný záměr dodržovat pravidla je lepší než „slibujeme, že jsme si přečetli robots.txt".

Cesta vpřed

Nezběsťme se. Toto je výzkumný návrh, ne standard. Adopce by vyžadovala podporu od velkých AI poskytovatelů, tvůrců prohlížečů a širší vývojářské komunity.

Načasování je ale správné. Neformální ekonomika scrapování se rozpadá, právní spory ohledně AI trénovacích dat se množí a existuje skutečná poptávka po standardech, které nevyžadují enterprise CDN kontrakty.

V NameOcean sledujeme, jak infrastrukturní debaty jako tato formují evoluci webu. Ať už registrujete domény, hostujete aplikace nebo stavíte další generaci AI nástrojů, pochopení těchto protokolových konverzací vám pomůže předvídat, kam se internet ubírá.

Boti nezmizí. Otázka je, jestli postavíme spravedlivý systém pro řízení jejich přístupu — nebo budeme dál předstírat, že textový soubor, který může každý ignorovat, je dostatečný.

Co si myslíte? Je formální vyjednávání mezi weby a AI systémy nevyhnutelné? Podělte se o své myšlenky.

Read in other languages:

BG EL RU UZ FI TR SV HU RO PT PL IT NL FR NB DA ZH-HANS DE ES EN