ИИтак

← Назад

Модель · Google

Veo 3.1

Видеомодель Google в статусе предварительной версии: ролики со звуком по тексту и картинкам, продление сцен и переходы между кадрами

вышла 15 октября 2025

Характеристики

Вышла
15 октября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
480 токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 8,2 тыс. токенов
Понимает
текст, изображения
Отвечает
видео
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
veo-3.1-generate-preview
Статус
бета

Что это за модель

Veo 3.1 — модель Google, которая делает короткие видео по текстовому описанию или по картинке. Звук она создаёт вместе с изображением: реплики героев, шумы, звуковые эффекты. Ролик длится 4, 6 или 8 секунд, бывает горизонтальным или вертикальным. Разрешение — до 1080p и 4K, но только для восьмисекундных роликов.

По сравнению с Veo 3 компания заявляет более богатый звук, лучшее понимание кинематографических стилей и более точное следование запросу при оживлении картинки. Появились три инструмента управления. Можно дать до трёх опорных картинок с персонажем, предметом или местом, чтобы они выглядели одинаково в разных сценах. Можно задать первый и последний кадр, и модель сама снимет переход между ними со звуком. Готовый ролик можно продлевать кусками по 7 секунд, до 20 раз: каждый новый кусок продолжает последнюю секунду предыдущего. Стоит Veo 3.1 столько же, сколько Veo 3. Вместе с ней вышла более быстрая Veo 3.1 Fast, позже появилась дешёвая Veo 3.1 Lite.

Модель берут для рекламных и сюжетных роликов, где важно сохранить одного и того же героя в нескольких сценах или связать сцены в длинное видео. Она работает в Gemini API, Vertex AI, приложении Gemini и видеоредакторе Flow. Сейчас документация Google советует по умолчанию брать более новую Gemini Omni Flash, в том числе для правки видео в диалоге. Veo 3.1 остаётся для продления сцен, управления последним кадром и уже готовых процессов, построенных на ней.

Ограничения назвала сама Google. Продлевать можно только ролики в 720p, а входное видео не должно быть длиннее 141 секунды. Все ролики помечаются невидимым водяным знаком SynthID, чтобы их можно было опознать как созданные нейросетью. Готовые файлы хранятся на серверах два дня, потом удаляются. Перед выдачей видео проходит фильтры безопасности и проверку на повтор обучающих данных. В ЕС и Великобритании генерация людей ограничена.

Источники: Анонс Veo 3.1 в Gemini API, Документация Veo 3.1, Генерация видео в Gemini API

Другие модели семейства

Данные: models.dev (MIT).