Когда ИИ встречается с Pokémon: рост игровых бенчмарков для кодовых агентов

Когда ИИ встречается с Pokémon: рост игровых бенчмарков для кодовых агентов

Сен 09, 2026 ** ai coding agents machine learning benchmarks gaming ai

Когда ИИ встречается с Pokémon: появление игровых бенчмарков для кодинг-агентов

Будем честны: мы все наблюдали, как модели ИИ покоряют очередной бенчмарк, испытывая ту же смесь восхищения и легкого разочарования, что и при раскрытии секрета фокусника. Да, модель решила 95% задач по разработке программного обеспечения. Но может ли она действительно думать?

Именно этот вопрос лежит в основе некоторых увлекательных новых исследований в сообществе ИИ — и ответ может вас удивить. Исследователи начали использовать бои в Pokémon как неожиданно эффективные бенчмарки для оценки кодинг-агентов, и результаты выявляют кое-что важное о том, куда движутся возможности ИИ.

Проблема насыщения бенчмарков

Каждый исследователь ИИ знает это чувство: вы месяцами создаете идеальный бенчмарк, только чтобы увидеть, как модели легко проходят его в течение нескольких месяцев после релиза. TerminalBench, FrontierSWE, HumanEval — выбирайте на свой вкус. Бенчмарки, которые, как мы думали, выдержат испытание временем, взламываются быстрее, чем вы успеваете произнести «state of the art».

Это произошло с Pokémon FireRed. Когда Anthropic объявила, что Claude Fable 5 может пройти классическую игру, используя только зрение, это произвело впечатление. Но вот в чем дело: модель по сути использовала стратегию грубой силы. Она перекачала стартового покемона (Чаризард достиг 76-го уровня, в то время как остальные члены команды застряли на 25-м уровне или ниже) и прокатилась катком по боям, которые никогда по-настоящему не бросали ей вызов.

Основные части игр Pokémon, будем реалистами, не являются аналогом Dark Souls. Они разработаны так, чтобы быть доступными и проходимыми. Это отлично для казуальных игроков, но делает их плохими тестами для возможностей ИИ. Если вы можете победить, просто «фармя» опыт, вы не проверяете стратегическое мышление.

Radical Red: Dark Souls мира Pokémon

На сцену выходит Pokémon Radical Red — ROM-хак, ставший своего рода легендой в сообществах Pokémon. Это не ваш детский опыт игры в Pokémon. Radical Red убирает страховочные колеса и заменяет их на:

  • Режим Set по умолчанию — никаких подсказок о том, какой покемон появится следующим
  • Ограничения по уровням, которые адаптируются, чтобы предотвратить чрезмерное «фармление»
  • Боссы с реальной стратегией — полные распределения EV, правильные предметы и наборы приемов, разработанные для противодействия стандартным стратегиям
  • Отсутствие предметов во время боя — то, что вы взяли с собой, то и имеете

Исследователи создали бенчмарк вокруг 21 тщательно отобранного боя с боссами из Radical Red, варьирующихся от тренеров на маршрутах до лидеров стадионов и даже командира Команды Ракет. Каждый бой сопровождается конкретными ограничениями: лимиты по уровням, ограниченные пулы покемонов и ограничения на размер команды, которые вынуждают к подлинному стратегическому мышлению.

Что делает этот бенчмарк интересным

Здесь начинается техническая часть (и, честно говоря, более интересная). Агенты не просто играют в игру — они программируют свой путь через нее.

Агент помещается в песочницу, содержащую все данные игры в виде JSON-файлов. Он может инспектировать эти файлы, искать по статистике покемонов, данным о приемах и свойствах предметов. Затем он конструирует команду, отправляя конфигурации через MCP-сервер, который управляет состоянием боя.

Доступные действия агента на удивление просты, но стратегически глубоки:

  • apply_team — Настроить всю вашу команду (выбор покемонов, EV, предметы, приемы, способности, характеры)
  • lead — Выбрать стартового покемона
  • action — Во время боя: использовать прием, сменить покемона или выпустить замену
  • observe — Проверить текущее состояние боя
  • reset — Начать заново

Это отражает то, как мы на самом деле оцениваем кодинг-агентов в реальных сценариях. Им нужно собирать информацию, формировать гипотезы, выполнять планы, учиться на ошибках и адаптироваться

Read in other languages:

BG EL CS UZ TR FI SV RO PL PT NB NL HU IT FR ES DA DE ZH-HANS EN