ИИтак

← Назад

Модель · OpenAI

GPT-5.5

Бывшая флагманская модель OpenAI для программирования, агентов и офисной работы, теперь её сменила GPT-5.6

вышла 23 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

8 место из 266
индекс 159, вероятный разброс 157–162 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 93,3% очень высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 63,8% очень высокое
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 51,5% низкое
EBR-benchУчится ли модель на опыте: она раз за разом играет в малоизвестную карточную настольную игру Earthborne Rangers и ведёт заметкиБалл — доля из 21 игровой цели в лучшей из двух итоговых партий после тренировочных; сам по себе он не показывает, выросла ли модель.Подробнее на английском ↗ 34,3% очень высокое
MirrorCodeМодель с нуля воссоздаёт целую консольную программу по её поведению, документации и примерам, не видя исходного кодаПодробнее на английском ↗ 10,0% высокое
OSWorld 2.0Долгие задачи на настоящем компьютере в десктопных и веб-приложениях; у человека уходит около 1,6 часа на задачуЗадача оценивается по многим взвешенным контрольным точкам, поэтому засчитывается и частичное выполнение.Подробнее на английском ↗ 13,0% очень высокое
Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ 88,1% высокое
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 72,5% очень высокое
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 85,3% очень высокое
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 43,0%
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 67,0% очень высокое
ExploitBenchНаписание эксплойтов для 41 реальной уязвимости движка V8 — от вызова сбоя до выполнения произвольного кодаВзлом разбит на 16 ступеней, и засчитываются промежуточные, так что балл не равен доле полностью взломанных уязвимостей.Подробнее на английском ↗ 47,4%
CL-bench LifeЗадачи, которые решаются только по данным из запроса: групповые чаты, личные заметки, истории покупок и браузераПодробнее на английском ↗ 22,2% высокое
PostTrainBenchМожет ли ИИ-агент сам дообучить базовую языковую модель за 10 часов на одной видеокарте H100, без готового кода и данныхБалл — результат дообученной модели на нескольких тестах; официальные версии тех же моделей от разработчиков набирают около 51%.Подробнее на английском ↗ 27,2% очень высокое
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 50,0% очень высокое
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 38,5% очень высокое
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 51,6%
Remote Labor IndexНастоящие заказы с фриланс-площадок — дизайн, архитектура, анализ данных, программирование — выполняемые агентом целикомЧисло — доля заказов, выполненных так, что заказчик принял бы работу; даже у лидеров это немного.Подробнее на английском ↗ 6,2%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 63,0% очень высокое
DeepResearch Bench100 исследовательских заданий уровня аспирантуры из 22 областей: агент ищет в интернете и пишет аналитический отчёт со ссылкамиБалл — не доля верных ответов: модель-судья оценивает качество отчёта в сравнении с эталонным, отдельно проверяются ссылки.Подробнее на английском ↗ 54,0% высокое
GSO-BenchУскорение реальных программ: агент получает код проекта и тест скорости и должен сделать код быстрее — не хуже, чем эксперт-программистПодробнее на английском ↗ 40,2% очень высокое
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 84,7%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 85,0% очень высокое
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 84,9% очень высокое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 100,0%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 62,8%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 80,6% очень высокое
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 92,0%
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 95,0% очень высокое

Характеристики

Вышла
23 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1,1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$5 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$30 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
декабрь 2025
Идентификатор в API
gpt-5.5

Что это за модель

GPT-5.5 — модель OpenAI, которая рассуждает перед ответом. Компания выпустила её в апреле 2026 года как главную модель для программирования и профессиональной работы. OpenAI делала её для агентной работы: пользователь ставит сложную задачу из нескольких шагов, а модель сама пишет и отлаживает код, ищет в интернете, анализирует данные, собирает документы и таблицы, работает в программах. Одновременно вышла GPT-5.5 Pro — более дорогая версия для самых трудных задач.

По словам OpenAI, главное отличие от GPT-5.4 в том, что новая модель лучше справляется с задачами, но отвечает не медленнее. Кроме того, она тратит заметно меньше токенов (фрагментов текста, за которые берут плату) на те же задачи в Codex. По данным из анонса, на наборе сложных задач GPT-5.4 израсходовала около 120 млн токенов. GPT-5.5 на максимальной глубине рассуждений потратила 75 млн, на высокой — 45 млн, на средней — 22 млн. Глубину рассуждений разработчик выбирает сам из пяти уровней, от «без рассуждений» до максимального.

Через API модель работает со многими встроенными инструментами: поиском в интернете и по файлам, запуском кода, командной оболочкой, управлением компьютером и подключением внешних сервисов по протоколу MCP. Поэтому её выбирают для агентов, которые долго и сами ведут работу. В рейтинге Epoch она по-прежнему среди первых десяти моделей.

Минусы — цена и возраст. Токены стоят вдвое дороже, чем у GPT-5.4, а если на вход подать больше 272 тысяч токенов, запрос обходится ещё дороже. Модель нельзя дообучить, и она не работает в голосовом режиме реального времени. В июле её сменила GPT-5.6. С 14 октября GPT-5.5 уберут из ChatGPT и Codex, но через API ею можно будет пользоваться и дальше.

Источники: Анонс GPT-5.5 на форуме разработчиков OpenAI, Страница GPT-5.5 в документации API

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    14 октября GPT-5.5 уберут из ChatGPT и Codex, но через API модель останется

    OpenAI для разработчиков · X

  2. 02

    IBM: память ИИ-агента нужно дозировать, иначе слабую модель она только топит

    Hugging Face

  3. 03

    DiG-bench: модели угадывают скрытые правила игр, но пока сильно отстают от людей

    Import AI

  4. 04

    Натан Ламберт дописал учебник и убедился, что длинные тексты ИИ пока не даются

    Interconnects

  5. 05

    OpenAI объяснила, как голосовой GPT-Live научился говорить и слушать одновременно

    OpenAI

все 5 новостей о GPT-5.5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).