EchoWM: открытые и входимые omnimodal-модели мира

JD.com

исследования офиц. + СМИ 2 ист. ~1 мин

Модель мира для входимых генеративных медиа, отвечающая на непрерывную навигацию и одновременно производящая 720p-видео с синхронизированным окружающим звуком, музыкой и речью. Взаимодействие организовано вокруг intent камеры: сцены от первого лица используют камеру для определения движения наблюдателя; сцены от третьего лица извлекают динамику камера-персонаж из данных. И дискретные команды, и непрерывные позы отображаются в общую относительную 6-DoF траекторию в метрической шкале с калибровкой движения на уровне датасета. Дополнительный движок данных и прогрессивная схема обучения плюс авторегрессионный пост-тренинг поддерживают совместное обучение аудио-визуальной генерации и управления траекторией. Авторы сообщают о сильном следовании траектории и визуальном качестве на публичных бенчмарках моделей мира как с взаимодействием от первого, так и от третьего лица.

Почему это важно

HF Daily 66 апвоутов 25 августа. Omnimodal (видео + аудио + речь) формулировка входимой модели под непрерывным 6-DoF-управлением — шаг за пределы прежних моделей мира, фокусировавшихся на одном типе движения камеры или только визуальном выходе; калибровка по гетерогенным источникам данных — практический рычаг.

Важность: 3/5

HF Daily 66 апвоутов

Источники

официальный arXiv abstract