Когда ИИ встречается с Pokémon: рост игровых бенчмарков для кодовых агентов
Когда ИИ встречается с Pokémon: появление игровых бенчмарков для кодинг-агентов
Будем честны: мы все наблюдали, как модели ИИ покоряют очередной бенчмарк, испытывая ту же смесь восхищения и легкого разочарования, что и при раскрытии секрета фокусника. Да, модель решила 95% задач по разработке программного обеспечения. Но может ли она действительно думать?
Именно этот вопрос лежит в основе некоторых увлекательных новых исследований в сообществе ИИ — и ответ может вас удивить. Исследователи начали использовать бои в Pokémon как неожиданно эффективные бенчмарки для оценки кодинг-агентов, и результаты выявляют кое-что важное о том, куда движутся возможности ИИ.
Проблема насыщения бенчмарков
Каждый исследователь ИИ знает это чувство: вы месяцами создаете идеальный бенчмарк, только чтобы увидеть, как модели легко проходят его в течение нескольких месяцев после релиза. TerminalBench, FrontierSWE, HumanEval — выбирайте на свой вкус. Бенчмарки, которые, как мы думали, выдержат испытание временем, взламываются быстрее, чем вы успеваете произнести «state of the art».
Это произошло с Pokémon FireRed. Когда Anthropic объявила, что Claude Fable 5 может пройти классическую игру, используя только зрение, это произвело впечатление. Но вот в чем дело: модель по сути использовала стратегию грубой силы. Она перекачала стартового покемона (Чаризард достиг 76-го уровня, в то время как остальные члены команды застряли на 25-м уровне или ниже) и прокатилась катком по боям, которые никогда по-настоящему не бросали ей вызов.
Основные части игр Pokémon, будем реалистами, не являются аналогом Dark Souls. Они разработаны так, чтобы быть доступными и проходимыми. Это отлично для казуальных игроков, но делает их плохими тестами для возможностей ИИ. Если вы можете победить, просто «фармя» опыт, вы не проверяете стратегическое мышление.
Radical Red: Dark Souls мира Pokémon
На сцену выходит Pokémon Radical Red — ROM-хак, ставший своего рода легендой в сообществах Pokémon. Это не ваш детский опыт игры в Pokémon. Radical Red убирает страховочные колеса и заменяет их на:
- Режим Set по умолчанию — никаких подсказок о том, какой покемон появится следующим
- Ограничения по уровням, которые адаптируются, чтобы предотвратить чрезмерное «фармление»
- Боссы с реальной стратегией — полные распределения EV, правильные предметы и наборы приемов, разработанные для противодействия стандартным стратегиям
- Отсутствие предметов во время боя — то, что вы взяли с собой, то и имеете
Исследователи создали бенчмарк вокруг 21 тщательно отобранного боя с боссами из Radical Red, варьирующихся от тренеров на маршрутах до лидеров стадионов и даже командира Команды Ракет. Каждый бой сопровождается конкретными ограничениями: лимиты по уровням, ограниченные пулы покемонов и ограничения на размер команды, которые вынуждают к подлинному стратегическому мышлению.
Что делает этот бенчмарк интересным
Здесь начинается техническая часть (и, честно говоря, более интересная). Агенты не просто играют в игру — они программируют свой путь через нее.
Агент помещается в песочницу, содержащую все данные игры в виде JSON-файлов. Он может инспектировать эти файлы, искать по статистике покемонов, данным о приемах и свойствах предметов. Затем он конструирует команду, отправляя конфигурации через MCP-сервер, который управляет состоянием боя.
Доступные действия агента на удивление просты, но стратегически глубоки:
- apply_team — Настроить всю вашу команду (выбор покемонов, EV, предметы, приемы, способности, характеры)
- lead — Выбрать стартового покемона
- action — Во время боя: использовать прием, сменить покемона или выпустить замену
- observe — Проверить текущее состояние боя
- reset — Начать заново
Это отражает то, как мы на самом деле оцениваем кодинг-агентов в реальных сценариях. Им нужно собирать информацию, формировать гипотезы, выполнять планы, учиться на ошибках и адаптироваться