OpenAI утроила результат GPT-5.6 в ARC-AGI-3, включив две настройки API
По данным OpenAI, GPT-5.6 утроила баллы в бенчмарке ARC-AGI-3 и потратила меньше ресурсов. Для этого модели сохранили рассуждения между шагами и включили сжатие контекста.
По словам OpenAI, GPT-5.6 утроила свои баллы в бенчмарке ARC-AGI-3. Модель при этом не меняли: компания включила в API две настройки.
Первая настройка сохраняет рассуждения модели. Модель не выбрасывает ход мысли после каждого шага, а продолжает опираться на него дальше. Вторая настройка включает сжатие контекста: по мере работы накопленная история ужимается, поэтому модель может дольше работать над одной задачей. По данным компании, выросли и баллы, и эффективность.
Выходит, что результат в сложном тесте зависит не только от самой модели, но и от того, как её запускают. В тот же день OpenAI опубликовала материал о том, как GPT-5.6 даёт больше интеллекта за каждый доллар. В нём компания тоже называла экономию в агентных процессах одним из трёх её источников.