ИИтак

← Назад

Модель · OpenAI

GPT-4o mini

Бюджетная модель OpenAI 2024 года для чатов и простых задач с текстом и картинками, сейчас устаревшая

вышла 18 июля 2024

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

170 место из 266
индекс 127, вероятный разброс 121–129 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 24,0%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 12,2%
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 3,1%
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 0,7%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 0,0%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 8,3%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 0,0%
GeoBenchПо фотографии улицы, как в игре GeoGuessr, модель должна угадать страну и точные координаты местаРезультат — очки, а не проценты: до 5000 за раунд, и чем дальше догадка от настоящего места, тем меньше очков.Подробнее на английском ↗ 64,0%
Lech Mazur WritingКороткие рассказы, в которые надо органично вплести десять заданных элементов: персонажа, предмет, место, мотив, тон и другиеБалл относительный: модели-судьи сравнивают рассказы попарно, ноль — примерно середина сравниваемых моделей, а не процент.Подробнее на английском ↗ 67,2%
VPCTПо картинке с горками и препятствиями модель должна предсказать, в какое из трёх вёдер упадёт шарикВёдер три, поэтому наугад можно набрать около 33%; люди в проверке решили все задачи.Подробнее на английском ↗ 1,0%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 11,8%
Aider polyglot225 трудных задач по программированию с Exercism на C++, Go, Java, JavaScript, Python и Rust; решение проверяют тестыДаются две попытки: после неудачи модель видит результаты тестов и исправляет код; засчитывается итог второй попытки.Подробнее на английском ↗ 3,6%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 6,9%
BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ 17,4%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 0,0%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 17,0%
GSM8KТекстовые задачи по математике школьного уровня в несколько действий; засчитывается только точный числовой ответТест почти насыщен: современные модели решают почти все задачи, и лидеры различаются слабо.Подробнее на английском ↗ 91,3%
MATH level 5Самые трудные задачи (5-й уровень) из набора MATH — задачи американских школьных олимпиад AMC 10, AMC 12 и AIMEТест близок к насыщению: у сильных моделей результаты почти одинаковые и высокие, разница в несколько пунктов мало что значит.Подробнее на английском ↗ 52,6%
MMLUВопросы с четырьмя вариантами ответа из десятков областей: гуманитарные и естественные науки, социальные науки, профессиональные знанияТест почти насыщен: сильные модели набирают около 90% и выше, и разница между лидерами мала, а часть промахов приходится на ошибки в самом тесте.Подробнее на английском ↗ 75,7%
PIQAБытовая физическая смекалка: из двух способов выполнить житейское действие выбрать тот, что сработаетЛюди отвечают верно примерно в 95% случаев; тест почти насыщен, и сильные модели различаются слабо.Подробнее на английском ↗ 77,4%

Характеристики

Вышла
18 июля 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,15 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,075 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,60 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
сентябрь 2023
Идентификатор в API
gpt-4o-mini

Что это за модель

GPT-4o mini — уменьшенная и удешевлённая версия GPT-4o, которую OpenAI выпустила летом 2024 года. Компания назвала её своей самой экономичной малой моделью. Она понимает текст и изображения, а отвечает текстом. Устройство и размер модели OpenAI не раскрыла. В документации её описывают как быструю и недорогую модель для узких задач.

GPT-4o mini сменила GPT-3.5 Turbo и в API, и в ChatGPT, где стала базовой моделью. По словам OpenAI, она больше чем на 60% дешевле предшественницы и при этом заметно умнее. По замерам лаборатории, в тесте на знания и рассуждения MMLU она набрала 82% против 77,9% у Gemini Flash и 73,8% у Claude Haiku. В задачах на программирование (HumanEval) у неё 87,2%, в мультимодальном тесте MMMU — 59,4%. Сейчас её давно обогнали новые линейки OpenAI: в рейтинге Epoch она стоит в нижней половине.

Модель берут там, где запросов много, а каждый из них прост: чат-боты поддержки с быстрыми ответами, цепочки из нескольких вызовов модели подряд, разбор длинной переписки или документов. OpenAI отдельно советует её для дообучения — подстройки модели под свою задачу на собственных примерах. Можно сделать и дистилляцию: обучить GPT-4o mini на ответах большой GPT-4o и получить похожее качество дешевле и быстрее.

Это малая модель, и в сложных рассуждениях, математике и длинных агентных задачах она заметно уступает флагманам. Её знания обрываются на 2023 годе. Веса закрыты, работать с моделью можно только через API и сервисы OpenAI. Эта модель первой получила «иерархию инструкций»: так OpenAI учит её ставить системные указания разработчика выше попыток пользователя их обойти.

Источники: Анонс GPT-4o mini в блоге OpenAI, Страница модели в документации OpenAI

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).