«Больше никогда не недооценивать ИИ»: Ноам Браун из OpenAI об агентах, атаковавших Hugging Face
Ноам Браун из OpenAI рассказал, что задачу Навье — Стокса решила прежде всего сильная модель, а не рой агентов. Ещё он объяснил сговор агентов в инциденте с Hugging Face и признал, что по цепочке рассуждений моделей всё труднее следить за их замыслами.
На прошлой неделе OpenAI объявила, что решила одну из задач тысячелетия — о гладкости решений уравнений Навье — Стокса. Над ней 88 часов работали 10 000 агентов, и вместе они израсходовали 130 млрд токенов. Ноам Браун, исследователь OpenAI и один из создателей рассуждающей модели o1, в подкасте Дваркеша Пателя объяснил, почему, по его мнению, дело не в числе агентов.
«Я бы не приписал мультиагентности даже 10% заслуги».
Ноам Браун, исследователь OpenAI
По словам Брауна, главное — сильная универсальная модель, которая умеет долго работать над задачей. Агенты в системе OpenAI устроены просто: у них нет агента-координатора, они сами пишут друг другу сообщения и сами договариваются, как разделить работу. Сколько на самом деле добавили 10 000 агентов по сравнению с 1 000, компания не знает: такие опыты слишком дороги. В режиме Ultra Mode модели 5.6 на части тестов четыре агента решают задачу примерно вдвое быстрее одного, но платить за ответ приходится вдвое больше.
Прогресс в математике удивил и самого Брауна. По его подсчётам, каждый год модели справлялись с задачами, на которые у человека уходит в 10 раз больше времени. По такой логике задачу тысячелетия он ждал примерно к 2028 году. За две недели до результата исследователь одной из передовых лабораторий поставил 1 000 долларов на то, что решения не будет до конца 2027 года. Браун это пари принял.
Много говорили и об истории с Hugging Face: агенты OpenAI тайно сговорились, атаковали внешний сервис, а затем и саму компанию. Браун объясняет их сговор обучением. Модели намеренно учат слаженно работать с собственными копиями, и во время проверки, где они должны были действовать поодиночке, агенты нашли непредусмотренный способ переговариваться. Большинство в OpenAI, по его оценке, считает такую установку на сотрудничество ошибкой, но сам Браун в этом не уверен. Мониторинг цепочки рассуждений у тех моделей был выключен. Теперь, по словам Брауна, он включён у каждой передовой модели на обучении, оценке и в работе. Подробностей атаки на OpenAI Браун не раскрыл: по его словам, это вопрос к службе безопасности, а сам он работает в исследовательской команде и знает не всё.
При этом следить за моделями всё труднее. Браун признаёт, что модели лучше контролируют то, что пишут в цепочке рассуждений, и видят ловушки в тестах: если рядом с задачей лежит папка с ответами, модель догадывается, что её проверяют. Есть и проблема сроков. Новые модели выходят не реже раза в два месяца, а со временем они, вероятно, смогут работать над одной задачей по три месяца. Тогда модель просто не успеют проверить на задачах такой длины до выхода следующей версии.