ИИтак

← Назад

Модель · Google

Gemini Omni 1.1 Flash

Видеомодель Google для создания и правки роликов по тексту и картинкам, продлевает сцены до 40 секунд

вышла 27 августа

Характеристики

Вышла
27 августа
Понимает
текст, изображения
Отвечает
видео
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
gemini-omni-1.1-flash

Что это за модель

Gemini Omni 1.1 Flash — видеомодель Google из линейки Gemini Omni. Она создаёт и редактирует ролики по текстовому описанию и картинкам-образцам. За один раз модель выдаёт клип длиной от 3 до 10 секунд со звуковой дорожкой, которая по умолчанию добавляется сама. Google называет эту версию готовой для рабочей среды и выпустила её в первую очередь для разработчиков.

Главное отличие от прошлой версии — модель лучше понимает, что уже было в ролике. При продлении сцены она учитывает до 10 секунд предыдущего видео, а раньше опиралась только на последнюю секунду. По словам компании, так продолжение лучше совпадает с началом. Сцену можно наращивать кусками по 10 секунд, но не дольше 40 секунд. Ещё модель научилась строить переход между заданными первым и последним кадром. Так делают облёт камерой, наезд или ролик, который закольцовывается без шва.

Модель подходит для рекламных и творческих роликов, раскадровок и коротких клипов для соцсетей. Её можно править в диалоге: просишь изменить готовое видео и уточняешь результат по шагам. Чтобы сохранить внешность персонажа или манеру движения, можно загрузить фрагмент чужого видео длиной до трёх секунд. Для быстрых черновиков есть режим 360p: по данным Google, он генерирует до 60% быстрее, чем 720p. Готовый ролик можно увеличить до 1080p или 4K. Модель доступна в Google AI Studio, Flow, на платформе Gemini Enterprise Agent Platform, а продление сцен работает и в приложении Gemini.

Есть ограничения. Продлевать ролик можно только с конца, дописать что-то перед началом нельзя. В загруженное видео, где уже есть речь, модель не добавит новые реплики, а голос править не умеет. Модель не принимает запрещающие запросы вида «без чего-то», системные инструкции и настройки случайности ответа. В Европейской экономической зоне, Швейцарии и Великобритании правка и продление загруженных роликов недоступны. Все видео получают невидимую метку SynthID, по которой можно понять, что ролик создал ИИ.

Источники: Анонс в блоге Google, Документация Gemini API

Новости о модели

  1. 01

    Приложением Gemini пользуются больше миллиарда человек в месяц: итоги августа у Google

    Google AI

  2. 02

    Видеомодель Gemini Omni 1.1 Flash научилась продлевать сцены до 40 секунд и выдавать 4K

    Google DeepMind

все 2 новости о Omni 1.1 →

Данные: models.dev (MIT).