ИИтак

← Назад

Модель · OpenAI

GPT-5

Устаревшая рассуждающая модель OpenAI для программирования, агентов и работы с текстом, первая в линейке GPT-5

вышла 7 августа 2025

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

47 место из 266
индекс 150, вероятный разброс 0–0 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 84,4% высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 47,0% высокое
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 15,2% среднее
EBR-benchУчится ли модель на опыте: она раз за разом играет в малоизвестную карточную настольную игру Earthborne Rangers и ведёт заметкиБалл — доля из 21 игровой цели в лучшей из двух итоговых партий после тренировочных; сам по себе он не показывает, выросла ли модель.Подробнее на английском ↗ 12,7% высокое
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 22,0% высокое
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 55,4% низкое
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 18,0% высокое
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 18,3% высокое
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 33,7%
Remote Labor IndexНастоящие заказы с фриланс-площадок — дизайн, архитектура, анализ данных, программирование — выполняемые агентом целикомЧисло — доля заказов, выполненных так, что заказчик принял бы работу; даже у лидеров это немного.Подробнее на английском ↗ 1,7%
GDPvalРеальные рабочие задачи из 44 профессий — юридические записки, таблицы, слайды, планы ухода; результат оценивают экспертыЧисло — доля задач, где эксперты сочли работу модели не хуже работы профессионала; 50% означает паритет с человеком.Подробнее на английском ↗ 34,8% среднее
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 50,1% высокое
DeepResearch Bench100 исследовательских заданий уровня аспирантуры из 22 областей: агент ищет в интернете и пишет аналитический отчёт со ссылкамиБалл — не доля верных ответов: модель-судья оценивает качество отчёта в сравнении с эталонным, отдельно проверяются ссылки.Подробнее на английском ↗ 49,6% низкое
GSO-BenchУскорение реальных программ: агент получает код проекта и тест скорости и должен сделать код быстрее — не хуже, чем эксперт-программистПодробнее на английском ↗ 6,9% высокое
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 49,6%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 9,9% высокое
METR Time HorizonsНасколько долгие для человека задачи по программированию, машинному обучению и кибербезопасности агент решает самостоятельноРезультат — не процент, а время: длительность задачи (по времени работы эксперта), которую модель решает примерно в половине случаев.Подробнее на английском ↗ 69,6% высокое
GeoBenchПо фотографии улицы, как в игре GeoGuessr, модель должна угадать страну и точные координаты местаРезультат — очки, а не проценты: до 5000 за раунд, и чем дальше догадка от настоящего места, тем меньше очков.Подробнее на английском ↗ 81,0% среднее
Fiction.LiveBenchВопросы по длинным художественным текстам: понять мотивы героев, порядок событий и сделать выводы из всего сюжетаРезультат зависит от длины текста: с ростом объёма точность обычно падает, поэтому сравнивать стоит при одинаковой длине.Подробнее на английском ↗ 97,2% среднее
Lech Mazur WritingКороткие рассказы, в которые надо органично вплести десять заданных элементов: персонажа, предмет, место, мотив, тон и другиеБалл относительный: модели-судьи сравнивают рассказы попарно, ноль — примерно середина сравниваемых моделей, а не процент.Подробнее на английском ↗ 86,0% среднее
VPCTПо картинке с горками и препятствиями модель должна предсказать, в какое из трёх вёдер упадёт шарикВёдер три, поэтому наугад можно набрать около 33%; люди в проверке решили все задачи.Подробнее на английском ↗ 49,0% высокое
HLEHumanity's Last Exam: 2500 вопросов экспертного уровня по математике, естественным и гуманитарным наукам, ответ не найти поискомПодробнее на английском ↗ 21,6% высокое
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 60,7% высокое
Aider polyglot225 трудных задач по программированию с Exercism на C++, Go, Java, JavaScript, Python и Rust; решение проверяют тестыДаются две попытки: после неудачи модель видит результаты тестов и исправляет код; засчитывается итог второй попытки.Подробнее на английском ↗ 88,0% низкое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 91,4%
BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ 32,8%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 48,0% высокое
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 73,6% высокое
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 81,6%
MATH level 5Самые трудные задачи (5-й уровень) из набора MATH — задачи американских школьных олимпиад AMC 10, AMC 12 и AIMEТест близок к насыщению: у сильных моделей результаты почти одинаковые и высокие, разница в несколько пунктов мало что значит.Подробнее на английском ↗ 98,1% высокое
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 65,7% высокое

Характеристики

Вышла
7 августа 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
400 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,25 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,125 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
сентябрь 2024
Идентификатор в API
gpt-5

Что это за модель

GPT-5 — первая модель линейки GPT-5 от OpenAI. Она рассуждает перед ответом, умеет вызывать внешние инструменты и понимает картинки на входе. В ChatGPT под этим названием работала целая система: быстрая модель для простых вопросов, рассуждающая модель для сложных и распределитель, который выбирает между ними. Через API идентификатор gpt-5 даёт доступ к рассуждающей модели. Рядом вышли облегчённые версии gpt-5-mini и gpt-5-nano.

Главным сценарием OpenAI называла программирование и агентные задачи, то есть многошаговую работу с инструментами без участия человека. По замерам компании, на бенчмарке SWE-bench Verified, где модель чинит реальные ошибки в программных проектах, GPT-5 набрала 74,9% против 69,1% у предшественницы o3. При этом, как заявляет OpenAI, ей понадобилось на 22% меньше токенов ответа и на 45% меньше вызовов инструментов, чем o3 с высоким уровнем рассуждений.

Разработчикам модель дала новые настройки. Глубину рассуждений можно выбрать из четырёх уровней, от минимального до высокого: чем меньше рассуждений, тем быстрее и дешевле ответ. Отдельный параметр задаёт, насколько подробно модель отвечает. А собственные инструменты модель может вызывать простым текстом, без сложного экранирования символов в формате JSON.

Сегодня GPT-5 — модель прошлого поколения. В документации OpenAI помечает её как устаревшую и советует переходить на GPT-6 Astra. После неё вышло несколько версий линейки, вплоть до GPT-5.6, и в рейтинге Epoch она уже далеко от вершины. Её знания заканчиваются сентябрём 2024 года, так что о более поздних событиях она без поиска не знает.

Источники: Анонс GPT-5 для разработчиков, Анонс GPT-5, Страница модели в документации OpenAI

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Уиллисон попробовал Jev: дёшево и быстро, но это ещё более «чёрный ящик», чем чат-боты

    Саймон Уиллисон

  2. 02

    Xiaomi выложила MiMo-V2.6-Flash-RL — облегчённую открытую модель для агентов

    MiMo · HF

  3. 03

    Xiaomi выпустила MiMo-V2.6-Pro-RL — открытую модель на 1 трлн параметров для агентов

    MiMo · HF

  4. 04

    V7 собирает из файлов компании «память» для агентов на моделях OpenAI

    OpenAI

  5. 05

    14 октября GPT-5.5 уберут из ChatGPT и Codex, но через API модель останется

    OpenAI для разработчиков · X

  6. 06

    OpenAI отдаёт госорганам США лицензии бесплатно и вдвое снижает цену на использование

    OpenAI

все 44 новости о GPT-5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).