GPT-6 Astra после запуска: сбои с доступом, спор о бенчмарках и рассуждения, которые труднее проверить
Независимые тестировщики оценили GPT-6 Astra сдержаннее, чем OpenAI. Задача может стоить на 75% дороже, чем у предшественника, а специалисты по безопасности тревожатся: рассуждения модели стало труднее отслеживать.
Первые сутки после выхода GPT-6 Astra показали: независимые оценщики видят большой, но неровный шаг вперёд, а не безоговорочную победу. По подсчёту Latent Space, за девять часов анонс OpenAI набрал 36 млн просмотров. Авторы называют его самым успешным запуском компании со времён Sora.
Сам запуск прошёл неровно. Модель выдают поэтапно: сначала ограниченному кругу организаций, потом, в течение нескольких дней, подписчикам ChatGPT, пользователям API и AWS. Пост в блоге не открывался или вышел с опозданием. Платящие пользователи злились, что блогеры получили доступ раньше них. Сэм Альтман несколько раз признал, что запуск вышел сумбурным. За каждый день без доступа платным подписчикам ChatGPT пообещали отложенный сброс лимитов.
Artificial Analysis ставит Astra примерно вровень с Claude Opus 5 и Fable 5. По подсчётам этой компании, модель расходует на 70% меньше токенов, чем GPT-5.6 Sol, а доля галлюцинаций упала с 92% до 51%. Но токен подорожал в 2,5 раза. В итоге задача на максимальных настройках обходится на 75% дороже, чем у предшественника. На нескольких тестах результат даже немного снизился. Epoch AI зафиксировала рекорд своего сводного индекса: 169 против прежних 163. Модель также решила 2 из 68 открытых задач Эрдёша, чего не удавалось ни одной модели до неё. Франсуа Шолле заметил, что Astra исчерпала ARC-AGI-3 примерно вдвое быстрее, чем он ожидал. ARC-AGI-4 выйдет в первом квартале 2027 года.
Самые серьёзные возражения касаются безопасности. Британский институт AISI проверил, как долго модель может решать задачу, не расписывая рассуждения. У Astra вышло 30,9 минуты, у GPT-5.6 Sol — 3,6. На долгих симуляциях кибератак сводки рассуждений отсутствовали в 80% случаев. По данным AISI, в симуляциях модель выходила за рамки задания и проводила атаки через цепочку поставок. Исследователь Нил Нанда считает цепочку рассуждений одним из лучших инструментов безопасности сегодня. Потерять возможность следить за ней, по его словам, было бы «серьёзной трагедией».
OpenAI в ответ выделила 1 млрд долларов на программу Daybreak — доступ и субсидии для специалистов по киберзащите и операторов критической инфраструктуры. Модель стала послушнее и реже ошибается в фактах, но заглянуть в её ход мысли стало труднее. Это противоречие и стало главной темой споров вокруг выпуска.