Az AI ördögi köre: miért kell aggódnunk a web jövőjéért?
Az MI "halálos spirálja": kényelmetlen igazságok a web jövőjéről
Az internet mindig is egy hallgatólagos megállapodáson működött: alkotók tartalmat gyártanak, platformok indexelik, felhasználók fogyasztják, mindenki jól jár. A keresőmotorok forgalmat küldenek a kiadóknak, a linkekre kattintanak az emberek. A rendszer ugyan messze nem volt tökéletes, de működtette a web milliónyi független alkotóját, hírportálját és vállalkozását.
De mi történik, ha az intermediary (közvetítő) úgy dönt, hogy már nincs szüksége arra, hogy bárhová küldjön?
Ez az az kényelmetlen kérdés, ami a New York Times OpenAI és Microsoft elleni perének nemrég nyilvánosságra hozott dokumentumaiban fogalmazódik meg – és a válaszok megdöbbentőek.
Tudták. Ez a legfájdalmasabb rész.
A legmeghökkentőbb momentum nem az, hogy az MI tanítása esetleg szerzői jogokat sért, vagy hogy a nagy nyelvi modellek bonyolult viszonyban állnak a forrásanyaggal. A legmeghökkentőbb rész az, hogy ezek a cégek tudták, mit csinálnak.
A Microsoft belső dokumentációi kifejezetten a "halálos spirál" (doom loop) megteremtésére irányuló MI-tartalomstratégiaként írták le a gyakorlatot, amely egyaránt "károsítja a modellek teljesítményét és a teljes webet." Elismerték, hogy termékeik fenyegetik "lényeges beszállítóik gazdasági alapjait" – vagyis azt a tartalomellátási láncot, ami ezeket a rendszereket lehetővé teszi.
Más szóval: meglátták a szakadékot, ráállították az autót, és tovább hajtottak.
Brent Hecht, a Microsoft alkalmazott tudományokért felelős igazgatója még közvetlenebb volt belső kommunikációjában: a data harvesting gyakorlatot "az emberiség történetének legnagyobb munka-lopásának" nevezte, és megjegyezte, hogy a Microsoft jogi védekezése "teljes csúfságot csinál a fair use fogalmából."
Persze, a Microsoft igyekezett távolságot tartani Hecht megjegyzéseitől, szóvivőjük "egyetlen alkalmazott egyéni véleményeként" jellemezve azokat. De amikor a saját belső dokumentumaik lényegében ugyanezt mondják, ezt a különbséget elég nehéz fenntartani.
A Supply Chain probléma, amit senki sem akar megvitatni
Itt van a modern MI-fejlesztés alapvető ellentmondása: a nagy nyelvi modelleknek rengeteg ember által létrehozott tartalomra van szükségük a működéshez. De ezek a modellek pont azért lettek tervezve, hogy kiküszöböljék az emberi közvetlen hozzáférés szükségességét ehhez a tartalomhoz.
A Microsoft saját dokumentumai elismerték ezt a paradoxont. Az LLM-ek az ő szavaikkal "olyan termékek, amelyek elpusztítják saját ellátási láncukat", mert helyettesítik azt a tanítóadatot, ami hasznossá teszi őket.
Gondoljunk bele, mit jelent ez. Minden alkalommal, amikor a ChatGPT vagy a Copilot válaszol egy kérdésre ahelyett, hogy egy forráshoz irányítaná a felhasználót, az egy potenciális olvasó, aki sosem kattint át. Az egy hirdetési bevétel, ami soha nem realizálódik. Egy alkotó, aki esetleg úgy dönt, hogy nem éri meg tartalmat gyártani.
És amikor a kút kiszárad – amikor kevesebb alkotó készít kevesebb olyat, amit érdemes megtanulni –, mi történik azokkal a modellekkel, amiket azon a tartalmon tanítottak?
A számok kegyetlenek
Az OpenAI saját elemzői becslése szerint a kiadóknak küldött keresési hivatkozási forgalom akár 60%-kal is csökkenhetett az MI-összefoglalók és chatbotok miatt, amelyek a felhasználókat a saját platformjukon tartják. A Google Zero – az a jelenség, amikor a weboldalak egyáltalán nem kapnak forgalmat a Google keresésből – elméleti aggályból sok kiadó számára megélt valósággá vált.
Satya Nadella maga is elismerte tanúvallomásában, hogy a chatbotok "lényegében helyettesítik a keresést és megszüntetik az igényt, hogy közvetlenül a forráshoz forduljunk az információért." Ez nem a rendszer hibája; ez az a funkció, ami ezeket a termékeket értékessé teszi a felhasználók számára.
Az OpenAI Nick Turley-je állítólag még közvetlenebb volt: ha egyszer választ kaptál a ChatGPT-től, "nincs jó ok arra, hogy rákattints" a forrás linkjére.
Mit jelent ez a fejlesztőknek és startupoknak?
Itt válik személyessé a téma, ha te vagy az a fejlesztő vagy startup alapító, aki a web következő generációs termékeit építi.
Az MI-vállalatok lényegében azzal érvelnek, hogy a régi szabályok már nem érvényesek – hogy az emberi tudás közösségét le kell aratni olyan proprietary rendszerek építéséhez, amelyek aztán helyettesítik az adott tudáshoz való hozzáférés szükségességét. És ezt teljes tudatában a okozott kárnak teszik.
Ennek a per jogi színjátékon túli következményei is vannak:
Az MI API-kra való támaszkodás kockázatos. Ha azok a cégek, amelyek ezeket a modelleket biztosítják, jogilag és etikailag kérdéses gyakorlatokban vesznek részt, a terméked alapja bizonytalanabb lehet, mint gondolnád.
A tartalmi partnerségek számítanak. A kiadók egyre kevésbé hajlandóak engedni, hogy tartalmukat kompenzáció nélkül scrapeljék. A jogi és üzleti környezet a licencelés irányába tolódik.
A hivatkozási forgalom gazdasága változik. Ha tartalmi üzletet építesz, nem alapozhatsz arra, hogy a keresési forgalom vagy a közösségi megosztások fenntartanak. Az MI-összefoglalók megválaszolhatják a felhasználók kérdéseit, mielőtt valaha is elérnék az oldaladat.
Az open web értékes. Azok az elvek, amik a webet hasznossá tették – az összekapcsolás, a hivatkozás, a forgalom áramlása a forrásokhoz – olyan ökoszisztémát hoznak létre, ami egyáltalán lehetővé teszi az MI működését. Ha ezt az ökoszisztémát kimeríthetetlen nyersanyagnak tekintjük, amit ki kell termelni, az végső soron önmagunkatromic.
A tökéletes irónia
Mindebben szinte tökéletes az irónia: a Microsoft, a Google és az OpenAI most kapkodva próbálnak tartalmi licencmegállapodásokat kötni azokkal a kiadókkal, akiket korábban károsítottak. Nadella maga mondta, hogy "ami paywall mögött van, azt licencelni kellene" – egy olyan álláspont, ami meggyőzőbb lenne, ha a Microsoft termékei nem töltöttek volna éveket a paywallas tartalmat fair use-ként kezelve a tanítóadatokban.
Az OpenAI képviselői a benyújtott dokumentumokban elismerték, hogy nem tudtak "semmiféle szisztematikus erőfeszítésről" a paywallas tartalom detektálására vagy eltávolítására a tanítóadatokból. Szóval az az MI, ami állítólag nyilvánosan elérhető információkon lett tanítva, úgy tűnik, elég nagy nehézségekbe ütközött megkülönböztetni a ingyenes és a paywallas tartalmakat.
Mi vár ránk?
A halálos spirál nem elmélet már. Valós időben történik, valódi alkotókkal, valódi kiadókkal, akik egyre ellenségesebb környezetben próbálják finanszírozni az újságírást és a tartalomgyártást.
Hogy a techipar azt állítja, az MI "demokratizálja az információt", miközben párhuzamosan elpusztítja az információ-létrehozás lehetőségét biztosító gazdasági modellt – ez nem innováció. Ez a bányászat ipara, Silicon Valley-s nyelvezetbe csomagolva.
A kérdés az MI-re építkező fejlesztőknek és vállalkozásoknak nem csak az, hogy "hogyan használhatjuk ezeket az eszközöket?" Hanem az, hogy "hogyan építhetünk olyan rendszereket, amelyek nem eszik meg a saját alapjukat?"
A web végső soron még mindig a forrás. Az API-k és chatbotok csak egy réteg rajta. És ha kollektívan úgy döntünk, hogy ez a réteg értékesebb, mint az alap, amin nyugszik, az egész konstrukció összeomlik.
A halálos spirál valós. Hogy az iparnak van-e elegendő bölcsessége kilépni belőle, mielőtt túl késő lesz, az még a jövő zenéje.