ИИтак

← Назад

Модель · OpenAI

GPT-4o

Устаревшая мультимодальная модель OpenAI для чата, работы с текстом и картинками, бывший флагман, которого сменила линейка GPT-5

вышла 13 мая 2024

Характеристики

Вышла
13 мая 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$2,50 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$1,25 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
сентябрь 2023
Идентификатор в API
gpt-4o

Что это за модель

GPT-4o — модель OpenAI, представленная в мае 2024 года. Буква «o» в названии означает «всё сразу»: компания обучила одну нейросеть, которая целиком, от входа до выхода, работает с текстом, изображениями и звуком. Раньше голосовой режим ChatGPT собирали из трёх отдельных моделей: одна переводила речь в текст, GPT-4 отвечала текстом, третья озвучивала ответ. По словам OpenAI, при такой схеме терялись интонация, голоса нескольких собеседников и фоновые звуки.

По данным анонса, на английском тексте и в программировании GPT-4o держится на уровне GPT-4 Turbo, а на других языках, с картинками и со звуком работает заметно лучше. В API она вдвое быстрее и вдвое дешевле GPT-4 Turbo. На голос модель, по замерам лаборатории, отвечает в среднем за 320 миллисекунд, что близко к темпу живого разговора. У предыдущих версий голосового режима на ответ уходило несколько секунд.

Долгое время GPT-4o была основной моделью ChatGPT. В документации OpenAI её называли универсальным флагманом и «лучшей моделью для большинства задач», если не брать рассуждающие модели серии o. Её выбирали для чат-ботов, обработки документов и скриншотов, несложного программирования и помощников общего назначения. Через API модель принимает текст и картинки, а отвечает только текстом. Работа со звуком доступна в отдельных голосовых вариантах.

Сейчас GPT-4o — модель прошлого поколения. После неё OpenAI выпустила рассуждающие модели серии o и линейку GPT-5, которые сильнее в сложных многошаговых задачах и агентной работе, то есть в самостоятельном выполнении цепочек действий с инструментами. При этом по цене GPT-4o остаётся в дорогой части каталога. Для новых проектов её берут в основном ради совместимости с уже отлаженными процессами.

Источники: Анонс GPT-4o от OpenAI, GPT-4o в документации OpenAI

Другие модели семейства

Данные: models.dev (MIT).