Google Research показала «ИИ-сорежиссёра» для многоминутных видео. Что внутри
Надстройка над Gemini и видеомоделью Veo следит, чтобы герои, декорации и предметы не менялись от сцены к сцене. Для демонстрации авторы сгенерировали фильм длиной десять минут.
Исследователи Google собрали из ИИ-агентов систему, которая по замыслу человека генерирует видео длиной в несколько минут, говорится в блоге Google Research. Главная её задача — следить, чтобы герои и обстановка не менялись от кадра к кадру. Систему назвали «ИИ-сорежиссёром». Она работает поверх Gemini и видеомодели Veo, но, по словам авторов, её можно поставить и над другими генеративными моделями.
«Сорежиссёр» собран из четырёх разработок, и каждая отвечает за свой этап — от замысла ролика до исправления ошибок. Одна из них, Co-Director, называется так же, как вся система, но это лишь её часть. Препринты о них выходили на arXiv с марта по май 2026 года, статьи о Co-Director и CANVAS представят на конференциях COLM 2026 и EMNLP 2026. Теперь авторы описали, как части работают вместе, и показали сгенерированный фильм длиной десять минут.
Видеомодели уже делают реалистичный клип за секунды, но историю из многих сцен собирают плохо. В обычных цепочках агентов у каждого шага свой запрос, написанный вручную. Между кадрами у героя меняется одежда, у комнаты — планировка, а ошибка на раннем шаге портит всё, что сделано после неё.
Части системы делят работу так:
- Co-Director берёт замысел человека и подбирает, как его воплотить: цель ролика, тип сюжета и визуальный стиль. Сочетания он перебирает алгоритмом многорукого бандита1 — пробует новые и повторяет удачные. Выбранный вариант уходит агентам, которые делают раскадровку, кадры, видео и звук. Модель-судья2 оценивает результат, и в следующем круге выбор уточняется;
- CANVAS ведёт память о героях, местах и предметах, чтобы при возвращении камеры в ту же локацию всё выглядело как прежде;
- A²RD генерирует фильм отрезками и перед каждым сверяется с памятью: то двигает сюжет вперёд, то привязывает кадр к уже показанным героям и местам;
- VQQA задаёт модели, которая понимает изображения, вопросы о готовом ролике и по её ответам переписывает текстовый запрос, а не правит пиксели.
Разницу авторы показывают на сцене ограбления музея. Gemini-3.1-Pro без надстройки меняет вид похищаемого экспоната и планировку зала, а в другой агентной системе, AutoStudio, вор между кадрами теряет кепку. В ролике о дуэте пианистки и скрипача обычная генерация после монтажной склейки отдавала скрипку пианистке. После правки запроса через VQQA каждый играет на своём инструменте.
Проверяли систему в том числе на собственных бенчмарках. В одном из них, LVBench-C, важный герой или предмет пропадает минимум на десять отрезков фильма и возвращается уже изменившимся по ходу сюжета.
Всё, что система генерирует через модели Google, получает водяные знаки SynthID3. Для рабочего применения авторы предлагают дополнительно проверять готовый фильм классификаторами безопасности4: безобидные по отдельности клипы вместе могут дать нежелательный контекст. Будет ли система доступна пользователям, в блоге не говорится. Следующим шагом авторы называют участие человека в самом процессе генерации.