ИИтак

← Назад

Модель · OpenAI

GPT-5.1

Устаревшая модель OpenAI для программирования и агентных задач; сама решает, сколько рассуждать. Её сменили GPT-5.5 и GPT-5.6

вышла 13 ноября 2025

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

49 место из 266
индекс 150, вероятный разброс 148–151 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 83,5% высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 51,6% высокое
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 10,8% среднее
CL-bench LifeЗадачи, которые решаются только по данным из запроса: групповые чаты, личные заметки, истории покупок и браузераПодробнее на английском ↗ 17,3% высокое
CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ 23,7% высокое
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 17,5% высокое
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 28,5%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 48,0% высокое
FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ 20,8% среднее
DeepResearch Bench100 исследовательских заданий уровня аспирантуры из 22 областей: агент ищет в интернете и пишет аналитический отчёт со ссылкамиБалл — не доля верных ответов: модель-судья оценивает качество отчёта в сравнении с эталонным, отдельно проверяются ссылки.Подробнее на английском ↗ 42,8% низкое
GSO-BenchУскорение реальных программ: агент получает код проекта и тест скорости и должен сделать код быстрее — не хуже, чем эксперт-программистПодробнее на английском ↗ 13,7%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 47,6%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 17,6% высокое
FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ 54,4%
VPCTПо картинке с горками и препятствиями модель должна предсказать, в какое из трёх вёдер упадёт шарикВёдер три, поэтому наугад можно набрать около 33%; люди в проверке решили все задачи.Подробнее на английском ↗ 38,0% высокое
HLEHumanity's Last Exam: 2500 вопросов экспертного уровня по математике, естественным и гуманитарным наукам, ответ не найти поискомПодробнее на английском ↗ 19,8%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 60,8% высокое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 88,6%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 43,8% высокое
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 68,0% высокое
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 83,5%
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 72,8% высокое

Характеристики

Вышла
13 ноября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
400 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,25 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,125 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
сентябрь 2024
Идентификатор в API
gpt-5.1

Что это за модель

GPT-5.1 — обновление линейки GPT-5, которое OpenAI выпустила в ноябре 2025 года. В ChatGPT она вышла в двух вариантах: GPT-5.1 Instant и GPT-5.1 Thinking. В API модель доступна под именем gpt-5.1. Главное изменение — адаптивные рассуждения: модель сама решает, сколько думать над задачей. На простые вопросы она отвечает быстро и тратит меньше токенов, а на сложных задачах рассуждает дольше.

От GPT-5 модель отличается прежде всего тем, как работает в программировании. Компания заявляет, что модель меньше «передумывает» простые задачи, пишет более качественный код, лучше слушается указаний о стиле работы и чаще сообщает пользователю, что делает, пока вызывает инструменты. По замерам OpenAI, в бенчмарке SWE-bench Verified GPT-5.1 решает 76,3% задач. В этом тесте модель получает репозиторий с кодом и описание ошибки и должна написать исправление. Разработчики могут совсем отключить рассуждения, если важнее скорость ответа.

Вместе с моделью OpenAI добавила в API два инструмента: один надёжнее правит файлы с кодом, другой позволяет модели выполнять команды в терминале. Ещё появилось расширенное кэширование запросов: повторяющаяся часть запроса хранится до 24 часов, а не несколько минут. Так ответы на уточняющие вопросы приходят быстрее и стоят дешевле. Модель брали для агентов-программистов, долгих задач с инструментами и обычной работы с текстом.

Сейчас GPT-5.1 устарела. У OpenAI вышли более новые модели этой линейки, в том числе GPT-5.5 и GPT-5.6, а в рейтинге Epoch GPT-5.1 далеко от первых мест. Имеет смысл выбирать её, только если приложение уже на ней построено и переходить на новую версию пока не хочется.

Источники: Анонс GPT-5.1 для разработчиков, Документация OpenAI о кэшировании запросов

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).