MiniMax запускает H3 — омни-модальную модель, генерирующую 2K-видео с нативным стерео-звуком

MiniMax

видео офиц. + СМИ 4 ист. ~1 мин

MiniMax официально запустил H3 31 июля — омни-модальную генеративную модель, совместно понимающую контекст текста, изображений, видео и аудио для создания клипов длиной до 15 секунд в 2K с нативным стерео-звуком, принимающую до 9 референсных изображений, 3 видеоклипов и 3 аудиоклипов в качестве управляемых входных данных. Модель доступна через API MiniMax и потребительское приложение Hailuo AI, открытые веса обещаны в ближайшие дни.

Почему это важно

Нативная совместная генерация аудио и видео в коммерческом качестве 2K с планируемыми открытыми весами продвигает открытые китайские лаборатории (конкурирующие с ByteDance и Kuaishou) в сегмент, ранее занятый закрытыми западными видеомоделями, при этом цена примерно на две трети ниже, чем у конкурентов.

Важность: 4/5

Крупный релиз омни-модальной видеогенерации с планируемыми открытыми весами и 4 независимыми подтверждениями (официальный источник + 3 СМИ).

Источники