Модель · OpenAI
o3-pro
Устаревшая дорогая версия o3 для сложных задач: дольше рассуждает ради надёжности ответа, её сменили модели GPT-5 Pro
вышла 10 июня 2025
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
57 место из 266
индекс 147, вероятный разброс 146–150 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 78,2% | высокое |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 45,3% | высокое |
| ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ | 4,9% | высокое |
| Fiction.LiveBenchВопросы по длинным художественным текстам: понять мотивы героев, порядок событий и сделать выводы из всего сюжетаРезультат зависит от длины текста: с ростом объёма точность обычно падает, поэтому сравнивать стоит при одинаковой длине.Подробнее на английском ↗ | 97,2% | среднее |
| Lech Mazur WritingКороткие рассказы, в которые надо органично вплести десять заданных элементов: персонажа, предмет, место, мотив, тон и другиеБалл относительный: модели-судьи сравнивают рассказы попарно, ноль — примерно середина сравниваемых моделей, а не процент.Подробнее на английском ↗ | 84,4% | среднее |
| WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ | 58,2% | высокое |
| Aider polyglot225 трудных задач по программированию с Exercism на C++, Go, Java, JavaScript, Python и Rust; решение проверяют тестыДаются две попытки: после неудачи модель видит результаты тестов и исправляет код; засчитывается итог второй попытки.Подробнее на английском ↗ | 84,9% | высокое |
| ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ | 59,3% | высокое |
Характеристики
- Вышла
- 10 июня 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 200 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 100 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $20 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $80 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- май 2024
- Идентификатор в API
- o3-pro
Что это за модель
o3-pro — рассуждающая модель OpenAI, то есть перед ответом она строит внутреннюю цепочку рассуждений. Её обучали с подкреплением: модель получала оценку за результат и так училась решать задачи. По сути это та же o3, но с большими вычислительными мощностями на каждый запрос. Такой вариант OpenAI обещала ещё в апреле 2025 года, когда выпустила o3 и o4-mini.
o3-pro пришла на смену o1-pro, построенной по той же схеме на прошлом поколении. OpenAI заявляла, что на внутренних и внешних тестах o3-pro обходит и o1-pro, и обычную o3, особенно в науке, математике, программировании и задачах, где цена ошибки высока. В ChatGPT модель сначала открыли подписчикам Pro и Team, через неделю — корпоративным и образовательным клиентам. Позже эту роль заняли Pro-версии линейки GPT-5, например GPT-5.5 Pro.
Компания советовала брать o3-pro для трудных вопросов, когда надёжность важнее скорости и можно подождать несколько минут. Модель умеет вызывать функции, искать в интернете и по загруженным файлам, подключаться к внешним сервисам по протоколу MCP и выдавать ответ в строгом формате (структурированный ответ). Она принимает на вход и картинки, так что может рассуждать над схемами и снимками.
Главные ограничения — скорость и цена. Один запрос может идти несколько минут, поэтому разработчикам советуют фоновый режим, иначе соединение оборвётся по тайм-ауту. В API модель доступна только через Responses API. Она не рисует картинки, не работает с голосом и в реальном времени, а в ChatGPT не поддерживала рисование и редактор Canvas.
Источники: Документация OpenAI по o3-pro, Заметки OpenAI к выпуску моделей
Того же уровня по индексу Epoch
-
Qwen3.7 Plus
Qwen58-е место в Epochконтекст 1 млн$0,50 / $3рассуждениядешевле в 27 раз
-
Qwen3.6 Plus
Qwen56-е место в Epochконтекст 1 млн$0,50 / $3рассуждениядешевле в 27 раз
-
Qwen3.5 397B-A17B
Qwen59-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждениядешевле в 22 раза
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).