ИИтак

← Назад

Runway рассказала, как модель мира GWM Worlds 2 создаёт интерактивное видео в реальном времени

GWM Worlds 2 на ходу достраивает видео, а пользователь им управляет: задаёт мир описанием и первым кадром, события — командами с отметками времени. Но мелкие ошибки копятся от кадра к кадру, а показанное раньше модель помнит не всегда.

Технический директор Runway Камиль Синди и ведущий научный сотрудник компании Робин Калов (Robin Kahlow) рассказали изданию Latent Space1, как устроена GWM Worlds 2. Эту модель мира Runway показала 3 сентября как предварительную исследовательскую версию. Издание также опубликовало подкаст с Анастасисом Германидисом — сооснователем и одним из руководителей Runway.

Runway — нью-йоркская компания, основанная в 2018 году. Сначала она делала инструменты для художников и обработки видео, а свои первые модели для генерации видео, Gen-1 и Gen-2, выпустила в 2023 году. В феврале она привлекла $315 млн, и, по сообщениям СМИ, её оценили в $5,3 млрд. Первую версию модели, GWM Worlds, компания выпустила в декабре 2025 года.

Модель мира, в отличие от обычного видеогенератора, не выдаёт готовый ролик. Она достраивает сцену кадр за кадром и откликается на действия пользователя. Runway называет свой подход авторегрессионной диффузией: каждый следующий кадр модель строит с опорой на уже созданные.

Главная новинка второй версии — формат запроса WorldPrompt. В нём пользователь закрепляет постоянную часть мира: обстановку, персонажей, правила вроде гравитации и первый кадр. Поверх этого идёт поток событий с отметками начала и конца, и новые события можно задавать прямо во время игры. Калов сравнил такое управление с компьютерной игрой: «Если где-то есть неигровой персонаж, он может подойти к вам и что-то сказать. С такой моделью можно добиться того же и очень детально управлять всем в сцене».

При этом WorldPrompt — способ давать модели запросы, а не язык программирования. В отличие от Minecraft или Roblox, писать скрипты и напрямую управлять состоянием мира нельзя. Насколько точно модель выполнит команду, зависит от сложности действия, признал Калов: «Движение, я бы сказал, работает довольно надёжно». По словам Синди, модель точнее следует командам по мере того, как компания наращивает обучение, данные и размер моделей.

Мир транслируется видеопотоком 720p с частотой 24 кадра в секунду, звук идёт с частотой 48 кГц. Для этого Runway дообучила свою базовую модель генерации видео со звуком понимать WorldPrompt. Затем её научили выдавать кадры по одному или небольшими группами.

Чтобы генерация шла в реальном времени, модель ускорили дистилляцией — так называют дообучение, после которого модель выдаёт почти тот же результат быстрее. Германидис уточнил, что дистилляция бывает двух видов: знания большой модели переносят в модель поменьше или учат модель обходиться меньшим числом шагов расшумления2. Для примера он привёл переход примерно с 50 шагов на четыре: качество немного падает, но результат часто сопоставим. Для моделей мира, по его словам, Runway сокращает именно число шагов.

«Главная проблема авторегрессионных моделей — накопление ошибок. Сгенерированные кадры снова подаются в модель, и любые мелкие ошибки со временем копятся», — предупредил Германидис. Синди добавил, что при бесконечной генерации приходится решать, какой контекст хранить, а какой отбрасывать, чтобы не переполнить память видеокарт. Память модели тоже неидеальна, и это пока открытая исследовательская задача, отметил Калов. По словам Германидиса, в открытых мирах GWM Worlds генерация держится порядка нескольких минут, а у модели говорящих аватаров Runway — до 30 минут.

Германидис считает, что модель мира должна одинаково правдоподобно показывать последствия разных действий пользователя. В роликах из интернета забитых голов больше, чем промахов, поэтому видеомодель убедительнее рисует гол. Именно здесь он видит главный разрыв между видеомоделями и моделями мира. Кроме игр, в Runway видят применение модели в робототехнике и в проверке ИИ-агентов в тысячах смоделированных сред. Структурированного описания мира агент при этом не получает: он, как и человек, видит только картинку и слышит звук.

← Все новости