Модель · Meta
Muse Realtime Avatar
Модель Meta, которая даёт агенту Muse лицо в видеозвонке: оживляет портрет, рисунок или предмет в реальном времени
вышла 23 сентября
Характеристики
- Вышла
- 23 сентября
- Понимает
- изображения, аудио
- Отвечает
- видео
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- —
- Идентификатор в API
- muse-realtime-avatar
Что это за модель
Muse Realtime Avatar — модель Meta Superintelligence Labs, которая превращает голос агента Muse в говорящий видеоаватар. Ей дают изображение-образец: фотопортрет, рисунок, животное или обычный предмет. Модель оживляет его прямо в разговоре. Портрет отвечает сдержанной мимикой, персонаж, нарисованный в полный рост, жестикулирует и меняет позу. Животные и предметы, по словам Meta, начинают выражать эмоции и при этом остаются узнаваемыми.
Модель работает в паре с Muse Realtime Voice — голосовой моделью, которая ведёт сам разговор. Muse Realtime Voice выдаёт поток речевых токенов, то есть мелких единиц, в которых закодировано и что сказано, и как. Аудиодекодер превращает этот поток в звук, а Muse Realtime Avatar строит по нему же видео, поэтому губы, голос и выражение лица совпадают. Внутри — диффузионный трансформер: такая модель собирает изображение, шаг за шагом убирая шум. Видео получается кусками по восемь кадров, это 320 миллисекунд, и каждый новый кусок опирается на уже готовые.
Чтобы успевать в реальном времени, Meta применила дистилляцию: большая модель-«учитель» делала 40 шагов расшумления, а компактную модель-«ученика» научили получать сопоставимый результат за два шага. Вычислений, по данным лаборатории, стало в 60 раз меньше. Аватар начинает отвечать примерно через 870 миллисекунд после реплики человека, а один ускоритель Nvidia GB200 обслуживает 12 разговоров одновременно. Meta сравнила модель с двумя коммерческими аватарами прямо в их продуктах для живых звонков. Люди по 2–3 минуты разговаривали с одинаковыми персонажами и оценивали картинку, синхронность речи и губ, постоянство облика и манеры. По замерам лаборатории, в общем зачёте модель Meta выбрали в 78% случаев против Runway Characters и в 88% против HeyGen LiveAvatar.
Это не отдельный генератор видео, а часть системы Muse: без голосовой модели аватар не работает. На момент анонса функцию показали только на сцене Meta Connect. Исследователи Meta обещают её «скоро» в приложении Muse и в брелоке Muse Charm. Meta уточняет, что примеры в её блоге демонстрируют возможности модели и в приложении будут доступны не все такие аватары. Во всё созданное видео встраивается невидимый водяной знак Meta Video Seal, а сам Muse доступен только с 18 лет.
Источники: Блог Meta о Muse Realtime Avatar, Анонсы Meta Connect 2026
Новости о модели
- 01
Данные: models.dev (MIT).