ИИтак

← Назад

Модель · OpenAI

GPT-5.6 Terra

Средняя модель линейки GPT-5.6 для программирования, агентов и повседневной работы — между флагманской Sol и бюджетной Luna

вышла 9 июля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

7 место из 266
индекс 159, вероятный разброс 157–162 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 87,6% максимальное
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 61,4% максимальное
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 28,4% среднее
Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ 83,8% очень высокое
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 70,7% максимальное
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 86,0% максимальное
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 41,3%
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 69,6% максимальное
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 74,0% очень высокое
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 51,6%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 43,2% максимальное
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 83,9% максимальное
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 78,3% высокое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 99,7%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 38,7%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 91,1%
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 96,5% максимальное

Характеристики

Вышла
9 июля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1,1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$2 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$12 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
февраль 2026
Идентификатор в API
gpt-5.6-terra

Что это за модель

GPT-5.6 Terra — средняя из трёх моделей линейки GPT-5.6, которую OpenAI выпустила в июле 2026 года. По возможностям линейка идёт так: бюджетная Luna, затем Terra, сверху флагманская Sol. Сама OpenAI называет Terra сбалансированной моделью для повседневной работы в рабочей среде. Перед ответом она рассуждает, и глубину этих рассуждений можно выбрать из шести уровней: от «none» (сразу отвечать) до «max». По умолчанию стоит средний уровень.

По словам компании, Terra работает лучше предыдущей GPT-5.5 и при этом стоит дешевле. Кроме того, на ту же задачу она тратит меньше токенов ответа, так что за каждый доллар выходит больше результата. Для самых сложных задач в линейке есть Sol, а Terra рассчитана на случаи, когда нужен баланс качества и расходов. В рейтинге Epoch она занимает седьмое место из 266, то есть держится близко к верху.

OpenAI советует брать Terra, чтобы писать код, обрабатывать тексты, извлекать данные в заданном формате и решать агентные задачи общего назначения. Агентная задача — это когда модель сама выполняет несколько шагов подряд с помощью инструментов. Через Responses API модель подключает встроенные инструменты: поиск в интернете, поиск по файлам, генерацию картинок и запуск кода. Ещё она умеет отвечать строго по заданной схеме и вызывать функции разработчика. Кроме платформы OpenAI, модель доступна в Amazon Bedrock и Microsoft Foundry.

Нужно учитывать одну оговорку. Если в запросе больше 272 тысяч входных токенов, весь запрос оплачивается по двойной цене за вход, так что работать с очень длинными документами заметно дороже. Звук и видео модель на вход не принимает. В Amazon Bedrock набор функций зависит от того, через какой адрес API идут запросы: на одном из двух нет встроенных инструментов и ответов по схеме.

Источники: GPT-5.6 Terra в документации OpenAI API, Карточка модели в Amazon Bedrock

Того же уровня по индексу Epoch

Новости о модели

  1. 01

    Xiaomi выложила MiMo-V2.6-Flash-RL — облегчённую открытую модель для агентов

    MiMo · HF

  2. 02

    Xiaomi выпустила MiMo-V2.6-Pro-RL — открытую модель на 1 трлн параметров для агентов

    MiMo · HF

  3. 03

    V7 собирает из файлов компании «память» для агентов на моделях OpenAI

    OpenAI

  4. 04

    14 октября GPT-5.5 уберут из ChatGPT и Codex, но через API модель останется

    OpenAI для разработчиков · X

  5. 05

    OpenAI отдаёт госорганам США лицензии бесплатно и вдвое снижает цену на использование

    OpenAI

  6. 06

    OpenAI предлагает GPT-6 Astra бизнесу: модель работает в программах без API

    OpenAI

все 36 новостей о GPT-5.6 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).