ИИтак

← Назад

DiG-bench: модели угадывают скрытые правила игр, но пока сильно отстают от людей

В DiG-bench 70 текстовых игр, где правила и цель скрыты от игрока. На самом сложном уровне справились только Claude Opus 5 и Fable 5 — примерно в 20% задач. Люди прошли все игры.

Исследователи придумали, как проверить, умеет ли ИИ сам разбираться в незнакомой обстановке. В новом бенчмарке DiG-bench (Discovery in Games — «открытия в играх») 70 игр. Игроку не сообщают ни правил, ни цели: их нужно выяснить, пробуя разные действия и глядя, что меняется. Лучше всех пока справляются Claude Opus 5 и Fable 5, но и им до людей далеко.

Каждая игра — маленький мир со своими законами, в духе визуального теста ARC-AGI1. Только здесь всё текстовое, так что языковым моделям ничего не нужно переводить в понятный им вид. Большинство партий целиком помещается в контекстное окно нынешних передовых моделей. Игры вручную сделали эксперты. Опубликованы 21, остальные держат закрытыми, чтобы модели не могли на них обучиться. Каждую игру прошёл хотя бы один человек, хотя многие участники жаловались на сложность.

Игры разбиты на семь уровней сложности. На каждом ходу у игрока от 2 до 34 вариантов действий. Лучший общий результат у Opus 5 и Fable 5 в связке с Claude Code, за ними идёт GPT-5.5. Задачи седьмого, самого трудного уровня смогли решить только Opus 5 и Fable 5 — около 20%. Часть задач шестого уровня прошли Opus 5, GPT-5.5 и Kimi K3, когда работали в обвязке2 вроде Claude Code. GLM-5.2 и Gemini 3.1 Pro добрались до отдельных этапов четвёртого уровня.

Над бенчмарком работали учёные из Оксфорда, Принстона, MIT, Inria, саудовского университета KAUST, Швейцарской лаборатории ИИ и группы Thinking About Thinking. Среди авторов — Юрген Шмидхубер3, один из ветеранов области. Часть игр можно попробовать самому на сайте проекта, там же есть таблица результатов.

Джек Кларк, сооснователь Anthropic и автор рассылки Import AI, считает такие тесты способом измерить предпосылку творчества — умение самостоятельно находить неописанные закономерности. Он прогнозирует, что модели сравняются с людьми на DiG-bench к середине 2027 года. «В этот момент нам стоит ожидать, что всерьёз начнётся что-то вроде рекурсивного самосовершенствования4», — пишет Кларк. Это его личная оценка, а не вывод авторов бенчмарка.

← Все новости