Модель · Google
Gemini Omni Flash Preview
Предварительная версия быстрой модели Google для генерации видео по тексту и картинке и правки роликов в диалоге
вышла 30 июня
Характеристики
- Вышла
- 30 июня
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 65 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1,50 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $17,50 за миллион токенов
- Понимает
- текст, изображения, видео
- Отвечает
- видео
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Идентификатор в API
- gemini-omni-flash-preview
Что это за модель
Gemini Omni Flash — первая модель в линейке Omni от Google. Её показали на конференции Google I/O в 2026 году. Она создаёт короткие ролики со звуком по текстовому описанию или по описанию с картинкой-образцом. По карточке модели, это трансформер со встроенной мультимодальностью: текст, изображения и видео на входе она обрабатывает вместе, а не отдельными модулями. Обучали её на тензорных процессорах Google (TPU).
Главное отличие от других видеомоделей Google — правка в диалоге. Сгенерировав ролик, можно попросить в следующем сообщении что-то поменять, и модель внесёт изменения, по словам Google, не трогая то, что менять не просили. Для этого в Gemini API есть Interactions API: он запоминает предыдущий шаг разговора. В документации ролики длятся от 3 до 10 секунд, выходят в горизонтальном (16:9) или вертикальном (9:16) формате, частота — 24 кадра в секунду.
Модель берут, когда видео нужно сделать быстро и доводить его несколькими короткими запросами: для роликов в соцсети, черновиков сцен, правки готовых клипов. Google встроила её в приложение Gemini, инструмент Flow, YouTube Shorts и Google Vids. Разработчикам она доступна через Gemini API под этим идентификатором. Позже вышла стабильная Gemini Omni 1.1 Flash. В ней появились продление сцен, заданные первый и последний кадр, видео-образцы на входе и повышение разрешения до 4K. Google советует переходить на неё.
В карточке модели Google называет слабые места: персонажи и детали могут меняться от правки к правке, плохо даются сложные движения и надписи в кадре. Менять речь в ролике пока нельзя — Google закрыла эту возможность из соображений безопасности. Загружать звук как образец API пока не позволяет. Правка и продление видео недоступны в Евросоюзе, Швейцарии и Великобритании. Все ролики помечены невидимым водяным знаком SynthID, по которому можно проверить, что видео создано нейросетью.
Источники: Карточка модели Gemini Omni Flash, Документация: генерация и правка видео в Gemini Omni Flash, Страница модели в Gemini API
Другие модели семейства
-
Gemini Embedding 2
Googleконтекст 8,2 тыс.$0,20 / $0
-
Gemini Embedding 001
Googleконтекст 2 тыс.$0,15 / $0
Данные: models.dev (MIT).