Tekoälyn synkkä kierre uhkaa verkon tulevaisuutta
Epämukava totuus tekoälyn "tuhoisesta kierrosta" ja mitä se tarkoittaa verkon tulevaisuudelle
Internet on aina toiminut epävirallisella sopimuksella: sisällöntuottajat luovat materiaalia, alustat indeksoivat sen, käyttäjät kuluttavat sitä, ja kaikki hyötyvät. Hakukoneet ohjaavat liikennettä julkaisijoille. Linkkejä klikataan. Järjestelmä, vaikka epätäydellinen, piti miljoonat riippumattomat luovat ammattilaiset, uutistoimistot ja yritykset pinnalla.
Mutta mitä tapahtuu, kun väliportaan toimija päättää, ettei sen enää tarvitse ohjata sinua mihinkään?
Tämä on epämukava kysymys, joka on hiljattain paljastuneiden oikeudenkäyntiasiakirjojen ytimessä. New York Timesin kanne OpenAI:tä ja Microsoftia vastaan sisältää raportointia, joka on räjäyttävää luettavaa.
He tiesivät. Se on se osa, mikä sattuu.
Järisyttävintä ei ole se, että tekoälyn kouluttaminen saattaa loukata tekijänoikeuksia tai että suuret kielimallit ovat monimutkaisessa suhteessa lähdemateriaaliin. Järisyttävintä on se, että nämä yritykset tiesivät mitä olivat tekemässä.
Microsoftin sisäinen dokumentaatio kuvaa tekoälystrategiaa nimenomaan "tuhoisaksi kehäksi", joka vahingoittaisi "mallien suorituskykyä ja koko verkkoa samanaikaisesti". He tunnustivat, että heidän tuotteensa uhkasivat "olennaisten toimittajien taloudellisia perusteita" siinä sisältöketjussa, joka mahdollistaa nämä järjestelmät.
Toisin sanoen: he näkivät rotkon, osoittivat autoa sitä kohti ja jatkoivat ajamista.
Brent Hecht, Microsoftin soveltavan tieteen johtaja, oli vielä suorasukaisempi sisäisessä viestinnässään ja kutsui datan keräämiskäytäntöjä "suurimmaksi työvoiman varkaudeksi ihmiskunnan historiassa". Hän huomautti myös, että Microsoftin oikeudellinen puolustus "teki täydellisen pilkan käsitteestä reilu käyttö".
Nyt on reilua todeta, että Microsoft on yrittänyt etäännyttää itseään Hechtin kommenteista, ja tiedottaja on luonnehtinut niitä "yhden työntekijän yksilönäkökulmaksi". Mutta kun oma sisäinen dokumentaatiosi sanoo käytännössä saman asian, tuota eroa on melko vaikea ylläpitää.
Tarjontaketjun ongelma, josta kukaan ei halua puhua
Tässä on modernin tekoälykehityksen perusristiriita: Suuret kielimallit tarvitsevat valtavia määriä ihmisten luomaa sisältöä toimiakseen. Mutta nämä mallit on suunniteltu poistamaan tarpeen ihmisille päästä käsiksi tuohon sisältöön suoraan.
Microsoftin omat asiakirjat tunnustivat tämän paradoksin. LLML:t ovat heidän sanojensa mukaan "tuote, joka tuhoaa oman tarjontaketjunsa", koska ne korvaavat sen koulutusdatan, joka tekee niistä hyödyllisiä.
Pysähdy hetkeksi miettimään, mitä tämä tarkoittaa. Joka kerta kun ChatGPT tai Copilot vastaa kysymykseen sen sijaan, että ohjaisi sinut lähteeseen, on potentiaalinen lukija, joka ei koskaan klikkaa eteenpäin. Se on mainostuloa, jota ei koskaan kerry. Se on sisällöntuottaja, joka saattaa päättää, että sisällön tuottaminen ei ole vaivan arvoista.
Ja kun kaivo kuivuu — kun vähemmän luojia tuottaa vähemmän asioita, joista kannattaa oppia — mitä tapahtuu niille malleille, jotka on koulutettu tuolla sisällöllä?
Luvut ovat karuja
OpenAI:n omien analyytikoiden arvioiden mukaan hakuviittausliikenne julkaisijoille on saattanut laskea jopa 60 % tekoälyn yhteenvetojen ja chatbotien vuoksi, jotka pitävät käyttäjät heidän alustoillaan. Google Zero — ilmiö, jossa verkkosivustot eivät saa lainkaan liikennettä Google-haun kautta — on muuttunut teoreettisesta huolesta monien julkaisijoiden todellisuudeksi.
Satya Nadella itse myönsi todistuksessaan, että chatbotit ovat "käytännössä korvanneet haun ja poistaneet tarpeen mennä suoraan lähteeseen tiedon saamiseksi". Tämä ei ole järjestelmän virhe; se on ominaisuus, joka tekee näistä tuotteista arvokkaita käyttäjille.
OpenAI:n Nick Turleyn kerrotaan olleen vielä suorasukaisempi: kun olet saanut vastauksen ChatGPT:ltä, ei ole "hyvää syytä klikata" linkkiä lähteeseen.
Mitä tämä tarkoittaa kehittäjille ja startupeille
Tässä kohtaa tämä asia koskettaa sinua — kehittäjää tai startupin perustajaa, joka rakentaa seuraavan sukupolven verkkotuotteita.
Tekoälyyritykset väittävät käytännössä, että vanhat säännöt eivät enää päde — että ihmiskunnan tiedon yhteismaa tulisi korjata proprietary-järjestelmien rakentamiseen, jotka sitten korvaavat tarpeen päästä käsiksi tuohon tietoon. Ja he tekevät sen täydessä tietoisuudessa aiheuttamastaan vahingosta.
Tällä on vaikutuksia laajemmin kuin NYT:n oikeudenkäynnin oikeudellisessa teatterissa:
Tekoäly-API:ihin luottaminen on riski. Jos näitä malleja tarjoavat yritykset harjoittavat laillisesti ja eettisesti kyseenalaisia toimintoja, tuotteesi perusta saattaa olla arvaamattomampi kuin kuvittelet.
Sisältökumppanuudet merkitsevät. Julkaisijat ovat yhä haluttomampia antamaan sisältöään raavittavaksi ilman korvausta. Oikeudellinen ja liiketoiminnallinen maisema on siirtymässä kohti lisensointivaatimuksia.
Viittausliikenteen talous on muuttumassa. Jos rakennat sisältöliiketoimintaa, et voi enää olettaa, että hakuliikenne tai sosiaalisen median jaot pitävät sinut pinnalla. Tekoälyn yhteenvedot saattavat vastata käyttäjien kysymyksiin ennen kuin he koskaan saapuvat sivustollesi.
Avoimella verkolla on arvoa. Periaatteet, jotka tekivät internetistä hyödyllisen — keskinäinen linkittäminen, lähteisiin viittaaminen, liikenteen ohjaaminen alkuperäisiin lähteisiin — luovat ekosysteemin, joka mahdollistaa tekoälyn alunperin. Tämän ekosysteemin kohteleminen ehtymättömänä resurssina, joka pillastetaan loppuun, on loppujen lopuksi itseään vastaan.
Iroonia riittää
Ehkä ironisin puoli kaikessa on se, että Microsoft, Google ja OpenAI kilpailevat nyt sisältölisensointisopimusten solmimisesta niiden julkaisijoiden kanssa, joita he ovat vahingoittaneet. Nadella itse sanoi "kaikki, mikä on maksumuurin takana, tulisi lisensoida" — tunne, joka olisi vakuuttavampi, jos Microsoftin tuotteet eivät olisi vuosia kohdelleet maksumuurin takana olevaa sisältöä reiluna pelinä koulutusdatana.
OpenAI:n edustajat myönsivät asiakirjoissa, että he eivät olleet "tietoisia" mistään systemaattisesta yrityksestä havaita tai poistaa maksumuurin takana olevaa sisältöä koulutusdatasta. Joten tekoäly, jonka väitettiin koulutetun julkisesti saatavilla olevaan tietoon, näyttää kohdanneen melkoisia vaikeuksia erottaa, mikä on ilmaista ja mikä maksumuurin takana.
Katsotaan eteenpäin
Tuhoisa kierre ei ole enää teoreettinen. Se tapahtuu reaaliaikaisesti, oikeille luojille, oikeille julkaisijoille, jotka yrittävät rahoittaa journalismia ja sisällöntuotantoa yhä vihamielisemmässä ympäristössä.
Teknologiateollisuudelta on röyhkeää väittää, että tekoäly "demokratisoi tietoa" samalla kun se tuhoaa talousmallin, joka tekee tiedon luomisen mahdolliseksi. Tämä ei ole innovaatiota. Tämä on kaivosteollisuutta Silicon Valleyn kielellä pukeutuneena.
Kysymys tekoälyn päälle rakentaville kehittäjille ja yrityksille ei ole vain "miten voimme käyttää näitä työkaluja?" Se on "miten voimme rakentaa järjestelmiä, jotka eivät kuluta omaa perustaa?"
Loppujen lopuksi verkko on edelleen lähde. API:t ja chatbotit ovat vain yksi kerros sen päällä. Ja jos me yhteisesti päätämme, että tuo kerros on arvokkaampi kuin perusta, jolla se lepää, koko kasa romahtaa.
Tuhoisa kierre on todellinen. Onko teollisuudella viisautta astua siitä ulos ennen kuin on liian myöhäistä, jää nähtäväksi.