ИИтак

← Назад

Модель · Google

Nano Banana 2

Основная модель Google для создания и правки картинок: почти уровень Pro, но быстрее и дешевле

вышла 28 мая

Характеристики

Вышла
28 мая
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
65 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$60 за миллион токенов
Понимает
текст, изображения, видео, PDF
Отвечает
текст, изображения
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-3.1-flash-image

Что это за модель

Nano Banana 2 (идентификатор в API — Gemini 3.1 Flash Image) — модель Google, которая создаёт и редактирует картинки по текстовому описанию и по присланным изображениям. В документации Google называет её универсальной рабочей моделью для любых задач с изображениями. Перед ответом она по умолчанию рассуждает: делает до двух черновых картинок, проверяет на них композицию и логику сцены и только потом выдаёт итоговую.

В линейке она стоит между первой Nano Banana и студийной Nano Banana Pro. По словам Google, по сравнению с первой версией она точнее выполняет указания, лучше держит одних и тех же персонажей от кадра к кадру и даёт более чёткие детали и фактуру. От Pro она отличается скоростью: часть предельного качества компания уступила ради более быстрой генерации, но большинство возможностей Pro сохранила. В API ей не хватает одной функции Pro: по документации она не выдаёт текст и картинки вперемешку в одном ответе, как в иллюстрированной истории. Есть и облегчённая Nano Banana 2 Lite: она быстрее, но рисует только в разрешении 1K.

Модель берут для рекламных макетов, открыток, инфографики, схем и визуализации данных. Google отдельно отмечает, что она пишет на картинках ровный и читаемый текст и умеет его переводить. Она опирается на знания Gemini о мире и может искать в Google актуальные данные и изображения, чтобы точнее нарисовать конкретный объект. Модель выдаёт картинки от 512 пикселей до 4K в разных пропорциях. Она принимает до 14 образцов: до 10 фотографий предметов и до 4 изображений персонажей, чтобы сохранить их облик.

Модель сразу стала основной для генерации картинок в приложении Gemini, режиме ИИ в Google Search, Google Lens, Flow и Google Ads. Разработчикам она доступна через Gemini API, AI Studio и Vertex AI. На созданные картинки ставится невидимая метка SynthID, по которой их можно распознать как сгенерированные. Веса модели закрыты.

Источники: Анонс Nano Banana 2 в блоге Google, Документация Gemini API: генерация изображений

Другие модели семейства

Данные: models.dev (MIT).