Kun tekoäly kohtaa Pokémonin: koodausagenttien pelipohjaisten vertailuarvojen nousu
Kun tekoäly kohtaa Pokémonin: Koodausagenttien pelipohjaisten vertailuarvojen nousu
Olkaa rehellisiä: olemme kaikki seuranneet tekoälymallien valloittavan uuden vertailuarvon samalla ihailun ja lievästi pettymyksen sekoituksella, joka syntyy nähdessään taikurin paljastavan temppunsa. Kyllä, malli ratkaisi 95 % ohjelmistokehityksen ongelmista. Mutta pystyykö se todella ajatttelemaan?
Tämä kysymys ohjaa joitakin kiehtovia uusia tutkimuksia tekoälyyhteisössä – ja vastaus saattaa yllättää sinut. Tutkijat ovat alkaneet käyttää Pokémon-taisteluita yllättävän tehokkaina vertailuarvoina koodausagenttien arvioinnissa, ja tulokset paljastavat jotain tärkeää tekoälyn kykyjen suuntauksesta.
Vertailuarvojen kyllästymisongelma
Jokainen tekoälytutkija tuntee tunteen: vietät kuukausia täydellisen vertailuarvon luomiseen, vain nähdäksesi mallien läpäisevän sen helposti muutamassa kuukaudessa julkaisusta. TerminalBench, FrontierSWE, HumanEval – valitse myrkky. Vertailuarvot, joiden luulimme kestävän ajan hampaan, murretaan nopeammin kuin ehdit sanoa "huipputeknologia".
Näin kävi Pokémon FireRedin kohdalla. Kun Anthropic ilmoitti, että Claude Fable 5 pystyy päihittämään klassisen pelin pelkän näkökyvyn avulla, se oli vaikuttavaa. Mutta tässä on asia: malli käytti käytännössä raakavoimaan perustuvaa strategiaa. Se ylitasotti aloitusPokémoninsa (Charizard tasolla 76, kun muun joukkueen jäsenet jäivät tasolle 25 tai sitä alemmas) ja mursi läpi taistelut, jotka eivät todellisuudessa haastaneet sitä.
Pääsarjan Pokémon-pelit, olkaamme rehellisiä, eivät ole aivan Dark Souls -tyyppisiä. Ne on suunniteltu helposti lähestyttäviksi ja voitettaviksi. Se on hienoa satunnaispelaajille, mutta tekee niistä heikkoja testejä tekoälyn kyvyille. Jos voit voittaa harjoittelemalla (grindaamalla), et todellisuudessa testaa strategista ajattelua.
Radical Red: Pokémonin Dark Souls
Tässä kuvioon astuu Pokémon Radical Red, ROM-hakkerointi, josta on tullut eräänlainen legenda Pokémon-yhteisöissä. Tämä ei ole lapsuutesi Pokémon-kokemus. Radical Red heittää harjoituspyörät pois ja korvaa ne seuraavilla:
- Set-tila oletuksena – ei vilkaisua seuraavaan Pokémoniin
- Tasorajat, jotka mukautuvat estääkseen liiallisen harjoittelun
- Pomotaistelut, joissa on oikeaa strategiaa – täydelliset EV-jakaumat, asianmukaiset esineet ja liikesetit, jotka on suunniteltu kumoamaan yleiset strategiat
- Ei esineitä taisteluiden aikana – mitä otat mukaan, sitä saat
Tutkijat rakensivat vertailuarvon 21 Radical Redistä huolellisesti valitun pomotaistelun ympärille, vaihdellen reittivalmentajista salijohtajiin ja jopa Tiimi Raketin komentajaan. Jokaiseen taisteluun liittyy tarkkoja rajoituksia: tasorajat, rajoitetut Pokémon-valikoimat ja joukkuekokorajoitukset, jotka pakottavat aitoon strategiseen ajatteluun.
Mikä tekee tästä vertailuarvosta kiinnostavan
Tässä kohtaa asia menee teknisemmäksi (ja rehellisesti sanottuna kiinnostavammaksi). Agentit eivät vain pelaa peliä – ne ohjelmoivat tiensä läpi sen.
Agentti sijoitetaan hiekkalaatikkoon, joka sisältää kaikki pelidata JSON-tiedostoina. Se voi tutkia näitä tiedostoja, etsiä Pokémonien