ИИтак

← Назад

Модель · Google

Gemini Omni Flash Preview

Предварительная версия быстрой модели Google для генерации видео по тексту и картинке и правки роликов в диалоге

вышла 30 июня

Характеристики

Вышла
30 июня
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$17,50 за миллион токенов
Понимает
текст, изображения, видео
Отвечает
видео
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
gemini-omni-flash-preview

Что это за модель

Gemini Omni Flash — первая модель в линейке Omni от Google. Её показали на конференции Google I/O в 2026 году. Она создаёт короткие ролики со звуком по текстовому описанию или по описанию с картинкой-образцом. По карточке модели, это трансформер со встроенной мультимодальностью: текст, изображения и видео на входе она обрабатывает вместе, а не отдельными модулями. Обучали её на тензорных процессорах Google (TPU).

Главное отличие от других видеомоделей Google — правка в диалоге. Сгенерировав ролик, можно попросить в следующем сообщении что-то поменять, и модель внесёт изменения, по словам Google, не трогая то, что менять не просили. Для этого в Gemini API есть Interactions API: он запоминает предыдущий шаг разговора. В документации ролики длятся от 3 до 10 секунд, выходят в горизонтальном (16:9) или вертикальном (9:16) формате, частота — 24 кадра в секунду.

Модель берут, когда видео нужно сделать быстро и доводить его несколькими короткими запросами: для роликов в соцсети, черновиков сцен, правки готовых клипов. Google встроила её в приложение Gemini, инструмент Flow, YouTube Shorts и Google Vids. Разработчикам она доступна через Gemini API под этим идентификатором. Позже вышла стабильная Gemini Omni 1.1 Flash. В ней появились продление сцен, заданные первый и последний кадр, видео-образцы на входе и повышение разрешения до 4K. Google советует переходить на неё.

В карточке модели Google называет слабые места: персонажи и детали могут меняться от правки к правке, плохо даются сложные движения и надписи в кадре. Менять речь в ролике пока нельзя — Google закрыла эту возможность из соображений безопасности. Загружать звук как образец API пока не позволяет. Правка и продление видео недоступны в Евросоюзе, Швейцарии и Великобритании. Все ролики помечены невидимым водяным знаком SynthID, по которому можно проверить, что видео создано нейросетью.

Источники: Карточка модели Gemini Omni Flash, Документация: генерация и правка видео в Gemini Omni Flash, Страница модели в Gemini API

Другие модели семейства

Данные: models.dev (MIT).