ИИтак

← Назад

Модель · OpenAI

GPT-5 Mini

Бюджетная уменьшенная GPT-5 для чётко поставленных задач, агентов и помощи в программировании; её сменили новые mini-модели

вышла 7 августа 2025

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

75 место из 266
индекс 146, вероятный разброс 144–147 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 67,5% высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 40,2% высокое
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 0,9% высокое
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 12,2% высокое
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 46,7%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 9,0% высокое
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 26,3%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 21,6% высокое
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 34,8%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 4,4% высокое
Fiction.LiveBenchВопросы по длинным художественным текстам: понять мотивы героев, порядок событий и сделать выводы из всего сюжетаРезультат зависит от длины текста: с ростом объёма точность обычно падает, поэтому сравнивать стоит при одинаковой длине.Подробнее на английском ↗ 69,4% среднее
Lech Mazur WritingКороткие рассказы, в которые надо органично вплести десять заданных элементов: персонажа, предмет, место, мотив, тон и другиеБалл относительный: модели-судьи сравнивают рассказы попарно, ноль — примерно середина сравниваемых моделей, а не процент.Подробнее на английском ↗ 83,1% среднее
VPCTПо картинке с горками и препятствиями модель должна предсказать, в какое из трёх вёдер упадёт шарикВёдер три, поэтому наугад можно набрать около 33%; люди в проверке решили все задачи.Подробнее на английском ↗ 10,3% среднее
HLEHumanity's Last Exam: 2500 вопросов экспертного уровня по математике, естественным и гуманитарным наукам, ответ не найти поискомПодробнее на английском ↗ 15,4%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 52,7% высокое
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 86,7%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 64,7% среднее
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 66,7%
MATH level 5Самые трудные задачи (5-й уровень) из набора MATH — задачи американских школьных олимпиад AMC 10, AMC 12 и AIMEТест близок к насыщению: у сильных моделей результаты почти одинаковые и высокие, разница в несколько пунктов мало что значит.Подробнее на английском ↗ 97,8% высокое
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 54,3% высокое

Характеристики

Вышла
7 августа 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
400 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,25 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,025 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$2 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
май 2024
Идентификатор в API
gpt-5-mini

Что это за модель

GPT-5 Mini — уменьшенная и более дешёвая версия GPT-5. OpenAI выпустила GPT-5 в API сразу в трёх размерах: gpt-5, gpt-5-mini и gpt-5-nano. Так разработчики могут сами решать, чем пожертвовать: качеством, ценой или скоростью ответа. Как и старшая модель, mini умеет рассуждать перед ответом.

В ChatGPT эта версия служит запасной: когда пользователь исчерпал лимит на основную модель, оставшиеся запросы обрабатывает mini. В системной карте GPT-5 её сравнивают с прошлой малой моделью o4-mini. По замерам OpenAI, на тесте фактических знаний SimpleQA mini ошибалась, то есть выдумывала ответ, в 26% случаев против 75% у o4-mini. Такой разрыв объясняют тем, что новая модель чаще честно признаёт, что ответа не знает. Компания также сообщает, что mini заметно обходит o4-mini на медицинском тесте HealthBench.

По словам OpenAI, лучше всего mini справляется с чётко сформулированными задачами и точными запросами. Её выбирают, когда запросов много и ответ нужен быстро: для простых агентов, помощи с кодом, повседневной автоматизации. Модель умеет вызывать функции, искать в интернете и по загруженным файлам, запускать код и выдавать ответ в строгом формате. Для неё работают настройки линейки GPT-5: подробность ответа и уровень рассуждений, вплоть до минимального — тогда модель отвечает быстрее, почти не раздумывая.

Модель принимает текст и картинки, но отвечает только текстом. Она не работает со звуком, не рисует и не обрабатывает видео, а дообучить её под свои данные нельзя. Её знания заканчиваются маем 2024 года. Сейчас это модель прошлого поколения: у OpenAI вышли более новые малые версии, например GPT-5.4 mini.

Источники: Документация OpenAI: GPT-5 mini, Системная карта GPT-5

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Уиллисон попробовал Jev: дёшево и быстро, но это ещё более «чёрный ящик», чем чат-боты

    Саймон Уиллисон

  2. 02

    Xiaomi выложила MiMo-V2.6-Flash-RL — облегчённую открытую модель для агентов

    MiMo · HF

  3. 03

    Xiaomi выпустила MiMo-V2.6-Pro-RL — открытую модель на 1 трлн параметров для агентов

    MiMo · HF

  4. 04

    V7 собирает из файлов компании «память» для агентов на моделях OpenAI

    OpenAI

  5. 05

    14 октября GPT-5.5 уберут из ChatGPT и Codex, но через API модель останется

    OpenAI для разработчиков · X

  6. 06

    OpenAI отдаёт госорганам США лицензии бесплатно и вдвое снижает цену на использование

    OpenAI

все 44 новости о GPT-5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).