Amikor a mesterséges intelligencia találkozik a Pokémonnal: a kódoló ügynökök játékalapú teljesítményértékeléseinek térnyerése
Amikor az AI találkozik a Pokémonnal: A kódoló ügynökök játékalapú benchmarkjainak térnyerése
Legyünk őszinték: mindannyian figyeltük, ahogy az AI-modellek újabb benchmarkokat hódítanak meg ugyanazzal a csodálkozás és enyhe csalódottság keverékével, ami egy bűvész trükkjének leleplezésekor szokott előkerülni. Igen, a modell megoldotta a szoftvermérnöki feladatok 95%-át. De tényleg képes gondolkodni?
Ez a kérdés hajtja az AI-közösségben zajló néhány lenyűgöző új kutatást – és a válasz meglepheti Önt. A kutatók a Pokémon-csatákat kezdik használni meglepően hatékony benchmarkként a kódoló ügynökök értékelésére, és az eredmények fontos dolgokat tárnak fel arról, hogy az AI-képességek merre tartanak.
A benchmark-telítődés problémája
Minden AI-kutató ismeri ezt az érzést: hónapokat tölt el a tökéletes benchmark kidolgozásával, csak hogy aztán lássa, ahogy a modellek a megjelenésük után hónapokon belül könnyedén végigrohannak rajta. TerminalBench, FrontierSWE, HumanEval – válasszon bármelyiket. Azok a benchmarkok, amelyekről azt hittük, hogy kiállják az idő próbáját, gyorsabban repednek meg, mint ahogy ki tudjuk mondani: „state of the art”.
Ez történt a Pokémon FireReddel is. Amikor az Anthropic bejelentette, hogy a Claude Fable 5 pusztán látás alapján megveri a klasszikus játékot, az lenyűgöző volt. De itt a lényeg: a modell lényegében brute-force (brutális erőszakos) stratégiát alkalmazott. Túlszintezte a kezdő Pokémonját (Charizard 76. szinten, míg a csapat többi tagja 25. szinten vagy alatta vegetált), és letarolta a csatákat, amelyek soha nem igazán állították kihívás elé.
A fő Pokémon-játékok, legyünk őszinték, nem éppen Dark Souls szintűek. Úgy tervezték őket, hogy könnyen hozzáférhetők és legyőzhetők legyenek. Ez nagyszerű az alkalmi játékosok számára, de rossz teszt az AI-képességek számára. Ha nyerhetünk puszta szintezéssel, akkor nem igazán a stratégiai gondolkodást teszteljük.
Radical Red: A Pokémon Dark Souls-a
Íme a Pokémon Radical Red, egy ROM hack, amely legendává vált a Pokémon-közösségekben. Ez nem a gyerekkori Pokémon-élmény. A Radical Red kidobja a segédkerekeket, és helyükbe a következőket teszi:
- Alapértelmezetten „set mode” – nincs belenyezés abba, hogy melyik Pokémon következik
- Szintkorlátok, amelyek alkalmazkodnak, hogy megakadályozzák a túlzott szintezést
- Főnöki csaták valódi stratégiával – teljes EV-elosztások, megfelelő tárgyak és olyan mozdulatsorok, amelyeket a generikus stratégiák ellen terveztek
- Nincsenek tárgyak csata közben – amit hozol, azt kapod
A kutatók egy benchmarkot építettek fel 21 gondosan kiválasztott Radical Red főnöki csata köré, amelyek az útvonal-trénerektől a tornavezetőkön át a Team Rocket parancsnokáig terjednek. Minden csata konkrét korlátozásokkal jár: szintkorlátok, korlátozott Pokémon-poolok és csapatméret-korlátozások, amelyek valódi stratégiai gondolkodásra kényszerítenek.
Mi teszi érdekessé ezt a benchmarkot
Itt válik technikailag érdekessé (és őszintén szólva, még érdekesebbé). Az ügynökök nem csupán játsszák a játékot – hanem programozzák magukat keresztül rajta.
Egy ügynök egy homokozóba (sandbox) kerül, amely tartalmaz