ИИтак

← Назад

Модель · SpaceXAI

Grok 4.6

Флагманская модель SpaceXAI для долгих агентных задач, программирования и интеллектуального труда

вышла 12 августа

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

17 место из 266
индекс 156, вероятный разброс 155–159 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 95,6% очень высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 57,0% очень высокое
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 27,3% очень высокое
EBR-benchУчится ли модель на опыте: она раз за разом играет в малоизвестную карточную настольную игру Earthborne Rangers и ведёт заметкиБалл — доля из 21 игровой цели в лучшей из двух итоговых партий после тренировочных; сам по себе он не показывает, выросла ли модель.Подробнее на английском ↗ 30,5% очень высокое
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 31,7% очень высокое
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 66,0% очень высокое
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 48,0%
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 67,5% среднее
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 51,0%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 41,2%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 36,9% очень высокое
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 49,3% высокое
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 67,1% очень высокое
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 67,3% высокое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 99,2% очень высокое
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 71,1%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 92,0% очень высокое
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 87,5% среднее

Характеристики

Вышла
12 августа
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
500 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 500 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$2 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$6 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
февраль 2026
Идентификатор в API
grok-4.6

Что это за модель

Grok 4.6 — флагманская модель SpaceXAI. Компания называет её основными задачами программирование, работу агентов и интеллектуальный труд. Агент здесь — это модель, которая сама выполняет задачу по шагам: вызывает инструменты, проверяет результат и решает, что делать дальше. Модель принимает текст, картинки и PDF, а отвечает только текстом.

Grok 4.6 продолжает Grok 4.5, которая вышла месяцем раньше. По словам SpaceXAI, новая версия сильнее сосредоточена на долгих агентных задачах и на более сложной интерактивной и визуальной работе. Базовая цена осталась прежней. К уровням глубины рассуждений добавился четвёртый, самый высокий: на трудных задачах модель может думать дольше, но это стоит больше токенов и времени. Для любых задач, включая код, SpaceXAI рекомендует именно эту модель и называет её самой умной и самой быстрой из своих.

Модель доступна через API SpaceXAI, в среде для программирования Grok Build, в редакторе кода Cursor и в Grok Bot в X. Её также подключили в облаках Amazon Bedrock, Microsoft Foundry и Google. Большое контекстное окно, то есть объём текста, который модель держит в памяти за раз, позволяет давать ей целые кодовые базы и длинные документы.

Есть и оговорки. Если запрос длиннее 200 тысяч токенов, цена за токен удваивается, поэтому гонять через модель очень длинные тексты дороже. Рассуждения всегда включены. Их текст выдаётся только в зашифрованном виде, так что посмотреть, как модель пришла к ответу, нельзя. Пакетную обработку, то есть отложенную отправку большого числа запросов со скидкой, API SpaceXAI для этой модели не поддерживает. Веса закрыты.

Источники: Документация Grok 4.6 от SpaceXAI, Заметки о выпуске API SpaceXAI, Карточка модели в Amazon Bedrock

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Маск: в тесте на офисную работу Grok 4.7 уступает только Anthropic

    Илон Маск

  2. 02

    Маск советует запускать Grok 4.7 в Grok Build: что умеет агент SpaceXAI для программистов

    Илон Маск

  3. 03

    Маск: по агентному программированию Grok 4.7 выводит его лабораторию на третье место после Anthropic и OpenAI

    Илон Маск

  4. 04

    SpaceXAI выпустила Grok 4.7 для кода и офисной работы по цене прошлой версии

    SpaceXAI

  5. 05

    «Интересно»: Маск отметил схему работы, где сложный код отдают GPT-6 Astra

    Илон Маск

  6. 06

    Grok 4.6 лучше других отсеял замаскированные опасные задачи по биологии, но пропустил 40%

    SpaceXAI

все 10 новостей о Grok 4.6 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).