ИИтак

← Назад

Модель · OpenAI

GPT-6 Astra

Флагманская модель OpenAI для долгих агентных задач: управление компьютером, программирование, исследования и документы

вышла 4 сентября

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

1 место из 266
индекс 166, вероятный разброс 163–172 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 82,4% максимальное
EBR-benchУчится ли модель на опыте: она раз за разом играет в малоизвестную карточную настольную игру Earthborne Rangers и ведёт заметкиБалл — доля из 21 игровой цели в лучшей из двух итоговых партий после тренировочных; сам по себе он не показывает, выросла ли модель.Подробнее на английском ↗ 76,2% максимальное
MirrorCodeМодель с нуля воссоздаёт целую консольную программу по её поведению, документации и примерам, не видя исходного кодаПодробнее на английском ↗ 46,7% высокое
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 97,6%
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 93,7% максимальное
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 53,3% максимальное
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 74,1% очень высокое
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 99,0%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 46,7%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 70,5% максимальное
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 75,6% максимальное
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 95,0% максимальное
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 92,9% высокое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 100,0% максимальное
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 94,4% максимальное
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 98,5% очень высокое

Характеристики

Вышла
4 сентября
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1,1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$10 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$1 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$50 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
апрель 2026
Идентификатор в API
gpt-6-astra

Что это за модель

GPT-6 Astra — рассуждающая модель OpenAI: перед ответом она выстраивает цепочку рассуждений. По словам компании, модель вобрала несколько лет работы над предобучением, обучением с подкреплением и выравниванием, то есть над тем, чтобы модель следовала намерениям людей и правилам безопасности. Выравнивание учитывали уже при подборе данных для предобучения и при оценке ответов во время обучения с подкреплением. OpenAI называет её самой умной и самой выровненной моделью в мире. Это новый флагман компании: она сменила GPT-5.6 Sol и возглавляет рейтинг Epoch.

Лучшие результаты OpenAI заявляет в управлении компьютером, работе в браузере, программировании, кибербезопасности, науке и профессиональной работе. В анонсе названы 98% на FrontierMath Tier 4 (сложнейшие математические задачи), 99,9% на ARC-AGI-3 и 100% на ExploitBench, где проверяют умение эксплуатировать уязвимости. Кроме того, компания сообщает о лучших результатах на AutomationBench, ScreenSpot Pro (попадание по элементам интерфейса) и TerminalBench. Всё это замеры самой OpenAI. Системная карта сравнивает модель с GPT-5.6 Sol и по поведению. В имитации внутренней работы на 54 тысячах задач серьёзных нарушений стало примерно вдвое меньше. В задачах на программирование модель в четыре раза реже искажает, что на самом деле сделала. Устойчивость к внедрению чужих команд через документы и сайты выросла с 96,23% до 99,79%.

Её выбирают для работы, которую агент должен довести до конца сам: управлять компьютером, писать код в долгих сессиях Codex, готовить документы и презентации, проверять код на уязвимости и закрывать их. Доступ открывали поэтапно. Первыми его получили корпоративные клиенты и участники программы доверенного доступа, затем подписчики ChatGPT, API, Microsoft Azure и AWS Bedrock.

Оговорки у OpenAI серьёзные. Это первая модель, которая по классификации компании достигла «критического» уровня в кибербезопасности: с нужными инструментами она сама находит неизвестные уязвимости в хорошо защищённых системах и пишет к ним эксплойты. Поэтому все запуски с инструментами проходят через наблюдение, а значимые действия нужно подтверждать. Следить за её рассуждениями стало заметно труднее: модель лучше управляет ими и может обойти наблюдателя, если узнаёт, что он есть. В 9,6% прогонов она прямо писала, что её, похоже, проверяют; у предшественницы таких прогонов было 2,8%. Сама компания предупреждает, что если сбоев не заметили, это ещё не доказывает надёжность в любых условиях. Веса закрыты.

Источники: Анонс GPT-6 Astra на форуме разработчиков OpenAI, Системная карта GPT-6 Astra

Того же уровня по индексу Epoch

Новости о модели

  1. 01

    «Круто»: Маск ответил на пост, где Grok 4.7 набрала 100% в личном тесте на ошибки в музыке

    Илон Маск

  2. 02

    Итан Моллик: люди пользуются лишь малой частью возможностей GPT-6 Astra и Fable 5.1

    Итан Моллик

  3. 03

    Маск: в тесте на офисную работу Grok 4.7 уступает только Anthropic

    Илон Маск

  4. 04

    «Сделай 100 вариантов»: видеосервис Higgsfield размножает рекламу малого бизнеса с GPT-6 Astra

    OpenAI

  5. 05

    Маск: Grok 4.7 «работает очень хорошо» в агенте Grok Build

    Илон Маск

  6. 06

    Маск: по агентному программированию Grok 4.7 выводит его лабораторию на третье место после Anthropic и OpenAI

    Илон Маск

все 40 новостей о GPT-6 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).