ИИтак

← Назад

Модель · OpenAI

GPT-5.3 Codex

Бывшая флагманская модель OpenAI для программирования и агентной работы с кодом, её уже сменили GPT-5.5 и более новые версии

вышла 5 февраля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

15 место из 266
индекс 157, вероятный разброс 154–160 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 31,8%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 78,4%
METR Time HorizonsНасколько долгие для человека задачи по программированию, машинному обучению и кибербезопасности агент решает самостоятельноРезультат — не процент, а время: длительность задачи (по времени работы эксперта), которую модель решает примерно в половине случаев.Подробнее на английском ↗ 74,5%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 79,3%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 74,8% высокое

Характеристики

Вышла
5 февраля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
400 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,75 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,175 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$14 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
август 2025
Идентификатор в API
gpt-5.3-codex

Что это за модель

GPT-5.3-Codex — модель OpenAI для программирования. На выходе OpenAI назвала её своей самой сильной агентной моделью для кода. «Агентная» здесь значит, что модель не просто подсказывает строки кода, а сама выполняет долгую задачу по шагам: читает репозиторий, правит файлы, запускает команды в терминале и проверяет результат. По словам OpenAI, это первая её модель, которая помогала создавать саму себя: команда Codex с помощью ранних версий искала ошибки в обучении, управляла развёртыванием и разбирала результаты оценок.

Компания заявляет, что модель объединила сильные стороны двух предшественниц: навыки программирования GPT-5.2-Codex и рассуждения и профессиональные знания GPT-5.2. При этом она работает на 25% быстрее и, по замерам лаборатории, тратит меньше токенов на ту же задачу. OpenAI сообщила о рекордных для отрасли результатах в бенчмарках SWE-Bench Pro и Terminal-Bench 2.0 и о сильных результатах в OSWorld-Verified (управление компьютером) и GDPval (задачи из реальных профессий). Ещё одно новшество — модель можно направлять прямо по ходу работы, как коллегу, и она не теряет контекст задачи.

Модель берут для правок в больших репозиториях, проверки кода, работы в терминале, создания сайтов по короткому описанию и поиска уязвимостей. Она доступна в приложении Codex, командной строке, расширениях для редакторов кода и через API. Разработчики могут выбрать, сколько усилий модель тратит на рассуждения: четыре уровня, от самого экономного до максимального.

Через API модель работает только в Responses API: классический интерфейс чата, пакетная обработка и дообучение для неё недоступны. По кибербезопасности OpenAI присвоила модели свой высший уровень возможностей, поскольку она умеет самостоятельно находить уязвимости. Сейчас это уже не новейшая модель лаборатории: её сменили GPT-5.5, GPT-5.6 и GPT-6 Astra.

Источники: Анонс GPT-5.3-Codex на форуме разработчиков OpenAI, Документация модели для разработчиков

Того же уровня по индексу Epoch

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).