OpenAI за неделю собрала API, где GPT-6 Luna выбирает ответ из вариантов
OpenAI открыла разработчикам пробный доступ к Decisions API, где модель выбирает ответ из заданных вариантов; внутри — обычная GPT-6 Luna, рассказал Никундж Ханда.
Decisions API, где модель выбирает ответ из заданных вариантов, OpenAI собрала примерно за неделю поверх готовой GPT-6 Luna, рассказал подкасту Latent Space1 руководитель продукта API Никундж Ханда.
Почему это важно: Jev, модель стартапа TypeSafe, не пишет текст, а выбирает один из заданных вариантов, и так сервисы быстро решают, куда отправить заявку или какое действие сделать следующим. Теперь разработчики могут получить такой выбор прямо в API OpenAI, а сама OpenAI, по словам ведущего подкаста, первой из ИИ-лабораторий повторила подход Jev.
Повод: когда вышла Jev, «все просто сходили с ума», вспоминает Ханда: пользователи писали в OpenAI о новинке, а внутренним командам понадобилась быстрая классификация. Прототип собрали два инженера — один из команды, которая отвечает за выдачу ответов моделей, другой из команды инфраструктуры. Ещё за четыре недели до DevDay2 такого продукта в планах не было.
Как это работает: Ханда называет продукт «по сути просто Luna».
- Новую модель не обучали: Decisions API работает на тех же весах GPT-6 Luna, что уже были у компании.
- Ответ модели жёстко ограничен заданными вариантами, как в режиме структурированного ответа.
- Если вопросов несколько, модель решает их параллельно, одним пакетом, а серверы, которые выдают её ответы, настроены на минимальную задержку.
- Рассуждений у модели нет, зато от Luna ей досталось понимание картинок, которого, по словам ведущего подкаста, у Jev нет.
Детали: первой новинку взяла команда, которая работает с пользователями: ей нужно было раскладывать по категориям все обращения в поддержку. Другие сотрудники собрали прототипы, где GPT Live, модель OpenAI для разговора в реальном времени, управляет компьютером через Decisions API. Вызовы инструментов в GPT Live всегда казались медленными, говорит Ханда, а так управление выходит «куда быстрее и естественнее».
Что говорят: «Повторить API Jev может кто угодно, это довольно тривиально. Но дальше — скорость, точность и калибровка», — сказал ведущий Latent Space Шон Ван. По его подсчёту, за две недели вышло около сотни копий Jev.
Но: калибровку, то есть умение модели честно оценивать свою уверенность в ответе, Ханда называет областью, которую, возможно, придётся подтягивать уже в следующих моделях. Ари Вайнштейн, который руководит в OpenAI агентами для управления компьютером, добавляет: без рассуждений и на небольшой модели Decisions API быстр, но хуже справляется с долгими сложными задачами.
Общая картина: сами компьютерные агенты, по словам Вайнштейна, за несколько месяцев изменились «на 180 градусов».
- Раньше модели уверенно начинали задачу, но застревали на первой же проблеме, а теперь ищут ошибку и пробуют снова.
- Агент не нажимает кнопки по одной, а пишет код на JavaScript, который выполняет сразу много действий.
- Кроме скриншотов, он читает структуру страницы и данные, которые приложения отдают программам чтения с экрана для незрячих, а ещё пользуется Playwright3.
- Разработчики, которые собирают своих агентов в новом Agents API, получили ту же систему управления компьютером, что в ChatGPT и агенте для программирования Codex, — на ней OpenAI и обучает свои модели.
Другая сторона: три месяца назад Дваркеш Патель4 спросил, почему прогресс в управлении компьютером такой медленный, хотя результат здесь легко проверить. Патель сам и ответил: для обучения нужны тысячи попыток в повторяемой среде, а тысячу агентов, оформляющих один и тот же заказ на Amazon, сайт быстро заблокирует. Вайнштейн надеется, что Патель передумал, и приводит свою оценку: в большинстве задач агент уже быстрее среднего человека, а следующая цель — обогнать опытных пользователей.
В цифрах: что ещё сотрудники OpenAI рассказали о моделях и API.
- GPT-6.1 Sol, по данным OpenAI, стоит впятеро меньше GPT-6 Astra, а на задачах управления компьютером — в семь раз меньше.
- Заказ в сервисе готовой еды, на который у Вайнштейна уходило два часа, агент на Sol оформил за 15 минут.
- Цену Luna раньше удалось снизить примерно на 80%, в основном потому, что модель научились экономнее запускать на серверах, говорит Ханда.
- Кэширование промптов избавляет модель от повторной обработки одинакового начала запросов и удешевляет ответ: 30 минут хранения OpenAI гарантирует, а 12 часов пока проверяет с одним клиентом.
Что дальше: OpenAI открыла пробный доступ к Decisions API 29 сентября, на DevDay. Широкий запуск Ханда обещал «в ближайшие дни», как только команда уложится в целевую задержку.