Модель · OpenAI
gpt-image-2
Модель OpenAI для создания и правки картинок с хорошо читаемым текстом на изображении; её сменила линейка gpt-image-2.5
вышла 21 апреля
Характеристики
- Вышла
- 21 апреля
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $5 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $1,25 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $30 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- изображения
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Идентификатор в API
- gpt-image-2
Что это за модель
gpt-image-2 — модель OpenAI, которая рисует картинки по текстовому описанию и правит готовые изображения. Ей можно дать фото или макет и попросить изменить только выбранную часть. Это называется инпейнтинг (inpainting): модель перерисовывает заданный участок и не трогает остальное. В ChatGPT на ней работала генерация картинок под названием ChatGPT Images 2.0. Разработчикам она доступна через API и в Codex, а в обычный чат-интерфейс API её подключить нельзя: у неё отдельные адреса API для создания и правки изображений.
Главное отличие от прошлых версий, по словам OpenAI, — более аккуратные правки, лучшая компоновка, точнее выполненные инструкции и надписи на разных языках. Компания отдельно выделяет схемы, инфографику и диаграммы: модель лучше справляется с картинками, где важна структура. Разрешение достигает 2K, соотношение сторон можно выбирать. OpenAI сообщала, что на старте модель заняла первое место во всех рейтингах Image Arena, где люди сравнивают картинки разных моделей. В тесте «текст в изображение» отрыв составил 242 балла.
Её берут для рабочих картинок: иллюстраций для приложений и рекламы, постов в соцсетях, слайдов и документации. Там особенно важно, чтобы надписи читались и макет не разваливался. Модель умеет делать прозрачный фон, поэтому подходит для иконок и элементов интерфейса. Её можно вызывать из агентов, которые сами собирают нужные изображения по ходу задачи.
В документации OpenAI перечисляет ограничения. Сложный запрос может обрабатываться до двух минут. Текст стал заметно лучше, но расположение и чёткость надписей всё ещё бывают неточными. Модели трудно держать одинаковыми повторяющихся персонажей и элементы бренда, а в макетах, где важна точная раскладка, она может поставить элемент не туда. Позже OpenAI выпустила линейку gpt-image-2.5 из двух моделей: Sunburst для точных правок и Flare для быстрой повседневной генерации.
Источники: Анонс gpt-image-2 для разработчиков, Карточка модели в документации OpenAI, Руководство по генерации изображений
Другие модели семейства
Новости о модели
- 01
Данные: models.dev (MIT).