Black Forest Labs выпускает FLUX 3 — мультимодальную модель, генерирующую видео с синхронизированным звуком

Black Forest Labs

видео офиц. + СМИ 3 ист. ~1 мин

Black Forest Labs выпустила FLUX 3 — передовую модель, совместно обученную на изображениях, видео и аудио в рамках единой архитектуры. Она способна генерировать клипы длиной до 20 секунд с синхронизированным звуком (диалоги, звуковые эффекты, окружающая среда) из одного промпта; компания также представила ответвление — модель для действий Flux-mimic, предназначенную для робототехники, совместно с партнёром Mimic Robotics AG. Video и Action доступны в раннем доступе через API и избранным партнёрам; генерация изображений и уровень Dev с открытыми весами запланированы на более поздний срок.

Почему это важно

Знаменует переход от раздельных конвейеров для изображений/видео/аудио к единой совместно обученной мультимодальной генеративной модели и расширяет ту же архитектуру на управление роботами — заметный шаг к унифицированным «моделям мира» для визуального и физического интеллекта.

Важность: 4/5

Флагманский релиз передовой модели от Black Forest Labs (новая мультимодальная архитектура), подтверждённый официальным постом и 2 независимыми СМИ.

Источники