Alibaba выпускает видеомодель Wan 3.0 с 30-секундной генерацией за один проход и нативным аудио

Alibaba (Tongyi Lab)

видео офиц. + СМИ 8 ист. ~1 мин

Alibaba Cloud выпустила Wan 3.0 2026-08-24 в виде вызываемого API на Model Studio / Qwen Cloud и в песочнице create.wan.video. Модель генерирует до 30 секунд за один проход (вдвое больше 15-секундного потолка Wan 2.7), выдаёт нативное 1080p-видео со звуком, отрендеренным в том же проходе, и принимает текстовые, графические, видео-, аудио- и документные (PDF / слайд / веб-страница) входы. Для документных входов требуется режим 'thinking', который позволяет модели рассуждать о композиции до рендеринга. На запуске доступны три эндпоинта — T2V, I2V (с опциональным управлением конечным кадром) и reference-to-video — принимающие до 10 референсных изображений, 5 референсных видеоклипов (всего 15 с при 16 fps+) и 5 референсных аудиодорожек (всего 15 с). Цены: $0.05/$0.10/$0.20 за секунду при 480p/720p/1080p, тариф 'Prime' — $0.068/$0.14/$0.28. Публичная бета шла с 2026-08-06; понедельничный анонс совпал с закрытием доразмещения Alibaba на HK$80 млрд — крупнейшего в Гонконге с 2021 года.

Почему это важно

Wan 3.0 удваивает потолок длины видео за один проход, заданный предыдущим поколением Wan, и добавляет нативное аудио в том же проходе, выводя флагманскую видеомодель Alibaba в одну функциональную категорию с ByteDance Seedance 2.5 и Hailuo H3. Референсная композиция (изображения / видеоклипы / аудиоклипы / документы как входы первого класса) позиционирует её как единую мультимодальную модель, а не чистую text-to-video систему. Wan остаётся API-only — Wan 2.2 по-прежнему последний open-weights флагман, так что для open-source потребителей это пока не drop-in замена.

Важность: 4/5

Frontier-tier video model release (Alibaba Wan 3.0)

Источники

официальный Alibaba Tongyi Wanxiang platform
СМИ Quartz — Alibaba launches Wan3.0 AI video model (syndicated from Reuters)