ИИтак

← Назад

Модель · OpenAI

o3-pro

Устаревшая дорогая версия o3 для сложных задач: дольше рассуждает ради надёжности ответа, её сменили модели GPT-5 Pro

вышла 10 июня 2025

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

57 место из 266
индекс 147, вероятный разброс 146–150 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 78,2% высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 45,3% высокое
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 4,9% высокое
Fiction.LiveBenchВопросы по длинным художественным текстам: понять мотивы героев, порядок событий и сделать выводы из всего сюжетаРезультат зависит от длины текста: с ростом объёма точность обычно падает, поэтому сравнивать стоит при одинаковой длине.Подробнее на английском ↗ 97,2% среднее
Lech Mazur WritingКороткие рассказы, в которые надо органично вплести десять заданных элементов: персонажа, предмет, место, мотив, тон и другиеБалл относительный: модели-судьи сравнивают рассказы попарно, ноль — примерно середина сравниваемых моделей, а не процент.Подробнее на английском ↗ 84,4% среднее
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 58,2% высокое
Aider polyglot225 трудных задач по программированию с Exercism на C++, Go, Java, JavaScript, Python и Rust; решение проверяют тестыДаются две попытки: после неудачи модель видит результаты тестов и исправляет код; засчитывается итог второй попытки.Подробнее на английском ↗ 84,9% высокое
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 59,3% высокое

Характеристики

Вышла
10 июня 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
200 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 100 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$80 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
май 2024
Идентификатор в API
o3-pro

Что это за модель

o3-pro — рассуждающая модель OpenAI, то есть перед ответом она строит внутреннюю цепочку рассуждений. Её обучали с подкреплением: модель получала оценку за результат и так училась решать задачи. По сути это та же o3, но с большими вычислительными мощностями на каждый запрос. Такой вариант OpenAI обещала ещё в апреле 2025 года, когда выпустила o3 и o4-mini.

o3-pro пришла на смену o1-pro, построенной по той же схеме на прошлом поколении. OpenAI заявляла, что на внутренних и внешних тестах o3-pro обходит и o1-pro, и обычную o3, особенно в науке, математике, программировании и задачах, где цена ошибки высока. В ChatGPT модель сначала открыли подписчикам Pro и Team, через неделю — корпоративным и образовательным клиентам. Позже эту роль заняли Pro-версии линейки GPT-5, например GPT-5.5 Pro.

Компания советовала брать o3-pro для трудных вопросов, когда надёжность важнее скорости и можно подождать несколько минут. Модель умеет вызывать функции, искать в интернете и по загруженным файлам, подключаться к внешним сервисам по протоколу MCP и выдавать ответ в строгом формате (структурированный ответ). Она принимает на вход и картинки, так что может рассуждать над схемами и снимками.

Главные ограничения — скорость и цена. Один запрос может идти несколько минут, поэтому разработчикам советуют фоновый режим, иначе соединение оборвётся по тайм-ауту. В API модель доступна только через Responses API. Она не рисует картинки, не работает с голосом и в реальном времени, а в ChatGPT не поддерживала рисование и редактор Canvas.

Источники: Документация OpenAI по o3-pro, Заметки OpenAI к выпуску моделей

Того же уровня по индексу Epoch

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).