Black Forest Labs выпускает FLUX 3 — мультимодальную модель, генерирующую видео с синхронизированным звуком
Black Forest Labs
Black Forest Labs выпустила FLUX 3 — передовую модель, совместно обученную на изображениях, видео и аудио в рамках единой архитектуры. Она способна генерировать клипы длиной до 20 секунд с синхронизированным звуком (диалоги, звуковые эффекты, окружающая среда) из одного промпта; компания также представила ответвление — модель для действий Flux-mimic, предназначенную для робототехники, совместно с партнёром Mimic Robotics AG. Video и Action доступны в раннем доступе через API и избранным партнёрам; генерация изображений и уровень Dev с открытыми весами запланированы на более поздний срок.
Почему это важно
Знаменует переход от раздельных конвейеров для изображений/видео/аудио к единой совместно обученной мультимодальной генеративной модели и расширяет ту же архитектуру на управление роботами — заметный шаг к унифицированным «моделям мира» для визуального и физического интеллекта.
Важность: 4/5
Флагманский релиз передовой модели от Black Forest Labs (новая мультимодальная архитектура), подтверждённый официальным постом и 2 независимыми СМИ.