ИИтак

← Назад

Модель · OpenAI

gpt-image-2

Модель OpenAI для создания и правки картинок с хорошо читаемым текстом на изображении; её сменила линейка gpt-image-2.5

вышла 21 апреля

Характеристики

Вышла
21 апреля
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$5 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$1,25 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$30 за миллион токенов
Понимает
текст, изображения
Отвечает
изображения
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
gpt-image-2

Что это за модель

gpt-image-2 — модель OpenAI, которая рисует картинки по текстовому описанию и правит готовые изображения. Ей можно дать фото или макет и попросить изменить только выбранную часть. Это называется инпейнтинг (inpainting): модель перерисовывает заданный участок и не трогает остальное. В ChatGPT на ней работала генерация картинок под названием ChatGPT Images 2.0. Разработчикам она доступна через API и в Codex, а в обычный чат-интерфейс API её подключить нельзя: у неё отдельные адреса API для создания и правки изображений.

Главное отличие от прошлых версий, по словам OpenAI, — более аккуратные правки, лучшая компоновка, точнее выполненные инструкции и надписи на разных языках. Компания отдельно выделяет схемы, инфографику и диаграммы: модель лучше справляется с картинками, где важна структура. Разрешение достигает 2K, соотношение сторон можно выбирать. OpenAI сообщала, что на старте модель заняла первое место во всех рейтингах Image Arena, где люди сравнивают картинки разных моделей. В тесте «текст в изображение» отрыв составил 242 балла.

Её берут для рабочих картинок: иллюстраций для приложений и рекламы, постов в соцсетях, слайдов и документации. Там особенно важно, чтобы надписи читались и макет не разваливался. Модель умеет делать прозрачный фон, поэтому подходит для иконок и элементов интерфейса. Её можно вызывать из агентов, которые сами собирают нужные изображения по ходу задачи.

В документации OpenAI перечисляет ограничения. Сложный запрос может обрабатываться до двух минут. Текст стал заметно лучше, но расположение и чёткость надписей всё ещё бывают неточными. Модели трудно держать одинаковыми повторяющихся персонажей и элементы бренда, а в макетах, где важна точная раскладка, она может поставить элемент не туда. Позже OpenAI выпустила линейку gpt-image-2.5 из двух моделей: Sunburst для точных правок и Flare для быстрой повседневной генерации.

Источники: Анонс gpt-image-2 для разработчиков, Карточка модели в документации OpenAI, Руководство по генерации изображений

Другие модели семейства

Новости о модели

  1. 01

    OpenAI выпустила ChatGPT Images 2.5: две модели для картинок — точная Sunburst и быстрая Flare

    Саймон Уиллисон

все 1 новость о gpt-image-2 →

Данные: models.dev (MIT).