När AI möter Pokémon: Framväxten av spelprestandatester för kodningsagenter
När AI möter Pokémon: Framväxten av spelprestandamätningar för kodningsagenter
Låt oss vara ärliga: vi har alla sett AI-modeller erövra ytterligare en prestandamätning med samma blandning av beundran och lätt besvikelse som uppstår när en trollkarl avslöjar sitt trick. Ja, modellen löste 95 % av mjukvarutekniska problem. Men kan den faktiskt tänka?
Det är frågan som driver en del fascinerande ny forskning inom AI-communityt – och svaret kanske överraskar dig. Forskare har börjat använda Pokémon-strider som förvånansvärt effektiva prestandamätningar för att utvärdera kodningsagenter, och resultaten avslöjar något viktigt om vart AI-förmågorna är på väg.
Mättnadsproblemet med prestandamätningar
Varje AI-forskare känner till känslan: du lägger månader på att skapa den perfekta prestandamätningen, bara för att se modeller ta sig igenom den med lätthet inom månader efter lanseringen. TerminalBench, FrontierSWE, HumanEval – välj din förgiftning. De mätningar vi en gång trodde skulle hålla tidens tand spräcks snabbare än du hinner säga ”state of the art”.
Detta hände med Pokémon FireRed. När Anthropic meddelade att Claude Fable 5 kunde besegra det klassiska spelet enbart med hjälp av syn, var det imponerande. Men här är saken: modellen använde i huvudsak en brutalkraftsstrategi. Den övertränade sin start-Pokémon (Charizard på nivå 76 medan resten av laget låg kvar på nivå 25 eller lägre) och krossade strider som aldrig riktigt utmanade den.
Huvudseriens Pokémon-spel är, låt oss vara ärliga, inte riktigt Dark Souls. De är designade för att vara tillgängliga och besegringsbara. Det är bra för casual-spelare, men gör dem till dåliga tester av AI-förmågor. Om du kan vinna genom att grinda, testar du inte riktigt strategiskt tänkande.
Radical Red: Pokémon-världens Dark Souls
Här kommer Pokémon Radical Red in, en ROM-hack som blivit något av en legend inom Pokémon-communityn. Detta är inte din barndoms Pokémon-upplevelse. Radical Red kastar ut stödhjulen och ersätter dem med:
- Set-läge som standard – inga möjligheter att titta på vilken Pokémon som kommer härnäst
- Nivåbegränsningar som anpassas för att hindra överdriven grindning
- Boss-strider med riktig strategi – fullständiga EV-fördelningar, korrekta föremål och draguppsättningar designade för att motverka generiska strategier
- Inga föremål under strider – det du tar med dig är det du får
Forskarna byggde en prestandamätning kring 21 noggrant utvalda boss-strider från Radical Red, allt från tränare på vägar till gymledare och till och med Team Rockets befälhavare. Varje strid kommer med specifika begränsningar: nivåbegränsningar, begränsade Pokémon-pooler och begränsningar för lagstorlek som tvingar fram genuint strategiskt tänkande.
Vad som gör denna mätning intressant
Här blir det tekniskt (och ärligt talat, mer intressant). Agenterna spelar inte bara spelet – de programmerar sig igenom det.
En agent placeras i en sandlåda som innehåller all speldata som JSON-filer. Den kan inspektera dessa filer, söka igenom Pokémon-statistik, data om attacker och egenskaper hos föremål. Sedan konstruerar den ett lag genom att skicka in konfigurationer via en MCP-server som hanterar stridstillståndet.
Agentens tillgängliga åtgärder är uppfriskande enkla men strategiskt djupa:
- apply_team – Konfigurera hela ditt lag (Pokémon-val, EV, föremål, attacker, förmågor, natur)
- lead – Välj din öppnings-Pokémon
- action – Under strid: använd en attack, byt Pokémon eller skicka in en ersättare
- observe – Kontrollera