Meta представила Muse Realtime Avatar — модель для говорящих видеоаватаров. Как это работает
Аватар начинает отвечать голосом и видео примерно через 870 мс после реплики человека. В сравнении, которое провела сама Meta, оценщики чаще выбирали его, а не аватаров Runway и HeyGen.
Meta представила Muse Realtime Avatar — модель, которая делает из голосового собеседника Muse Realtime Voice аватара на видео, говорится в исследовательском блоге компании. Аватар строится по образцу — фотографии или рисунку. Фотопортрет отвечает сдержанной мимикой, нарисованный персонаж в полный рост жестикулирует и меняет позу, а говорить могут даже животные и обычные предметы. В соцсети X Meta описала новинку как единую потоковую систему: разговор, голос и видео в ней связаны одним потоком речевых токенов.
Muse Realtime Voice ведёт беседу и выдаёт речевые токены, в которых закодировано и что сказано, и с какой интонацией. Из них аудиодекодер собирает речь, а Muse Realtime Avatar по тем же токенам генерирует видео. Поэтому голос, движения губ и мимика совпадают.
Сама модель — диффузионный трансформер1. Видео она выдаёт короткими фрагментами, и последние кадры каждого фрагмента задают движение в следующем. Так объём вычислений не растёт с длиной беседы, и генерация может идти столько, сколько идёт разговор.
Чтобы ускорить ответы, Meta обучила компактную модель-ученика повторять большую модель-учителя. Учитель проходит 40 шагов расшумления, и на каждом шаге его прогоняют трижды с разными наборами подсказок, а потом сравнивают результаты. Такой приём (управление без классификатора) помогает модели точнее следовать подсказкам, но в итоге на один фрагмент видео уходит 120 прогонов. Ученик при обучении усвоил и расшумление, и действие этого приёма, поэтому ему хватает двух прогонов без всякого сравнения — в 60 раз меньше, а качество, по оценке компании, почти не страдает. Ученика тренировали на кадрах, которые он сам сгенерировал, чтобы в долгом разговоре мелкие ошибки не накапливались и изображение не «уплывало».
Аватар выдаёт вертикальное видео 448×768 точек с частотой 25 кадров в секунду. От конца реплики пользователя до первого байта ответа с голосом и видео проходит около 870 мс. На одном GB2002 модель генерирует восемь кадров за 20 мс, а это 320 мс видео. Благодаря 4-битному обучению с учётом квантования3 и другим оптимизациям один GB200 ведёт 12 разговоров одновременно — в 8 раз больше, чем исходная двухшаговая версия.
Meta сравнила модель с Runway Characters и HeyGen LiveAvatar — коммерческими сервисами живых видеоаватаров, которые компания называет ведущими. Каждый сервис проверяли в его собственном режиме видеозвонка. Оценщики по две-три минуты разговаривали с аватарами одинаковой внешности и сравнивали качество картинки, синхронность, постоянство образа и манеру держаться. По общему впечатлению они чаще выбирали Muse Realtime Avatar, сообщает Meta.
В каждое сгенерированное видео встраивается невидимый водяной знак Meta Video Seal, по которому ролик можно отследить. По словам компании, задержку это не увеличивает. Meta оговаривает, что в приложении Muse есть не все аватары из примеров в блоге, а пользоваться Muse можно только с 18 лет.
Muse — личный ИИ-агент Meta. 8 сентября компания запустила его в WhatsApp и в отдельном приложении.
Meta Platforms Inc. признана в России экстремистской организацией, её деятельность запрещена.