Meta* представила Muse Realtime Avatar — технологию для видеодиалогов с ИИ-помощником Muse. Она создаёт движения лица и тела персонажа одновременно с его речью, поэтому разговор идёт в реальном времени.
В качестве основы можно использовать фотографический портрет, рисунок персонажа, изображение животного или даже предмета. Meta* показала примеры работы системы, но не сообщила сроки и условия доступа к технологии.
Читайте также: ТОП-5 бесплатных нейросетей для создания аватара
Как аватар отвечает на вопросы
Muse Realtime Voice формирует реплику и передаёт системе Avatar поток речевых токенов, содержащих информацию о том, что и как произносится. По мере разговора система создаёт видеоряд: подстраивает движение губ под речь, меняет выражение лица и, если персонаж показан целиком, добавляет жесты.
Технология учитывает предыдущие кадры, чтобы внешность героя не менялась между ответами. На фотографическом портрете это заметно по мимике, на нарисованной фигуре — по движениям рук и корпуса. Аватар можно оживить и по изображению животного или предмета.
Как быстро работает система
В демонстрации Meta* получала вертикальное видео 448 × 768 пикселей с частотой 25 кадров в секунду. Задержка от конца вопроса до первых данных ответа с синхронными голосом и видео составила около 870 мс.
В видео встроен невидимый водяной знак Meta Video Seal. Компания отдельно предупреждает, что показанные примеры демонстрируют возможности технологии: не все такие образы доступны в приложении Muse. Meta* не уточнила сроки распространения технологии и перечень аватаров, доступных в приложении.
Ранее Meta* выпустила Muse для Mac — агент работает с файлами и сообщениями.
Изображения: research.meta.ai/blog/bringing-your-muse-to-life
*Meta признана экстремистской организацией и запрещена в России.


