Joy Future Academy JD.com выпускает JoyAI-Echo 1.5 — 5-минутную аудиовизуальную генерацию с памятью персонажа и голоса между шотами

JD.com (Joy Future Academy)

видео официальный 5 ист. ~1 мин

28 августа 2026 года Echo Team из Joy Future Academy JD выпустил JoyAI-Echo 1.5 (Echo-LongVideo) — унифицированную систему аудиовизуальной генерации на базе Lightricks LTX-2.3 с 8-шаговым DMD-сэмплером, парной кросс-модальной памятью (слоты изображения + аудио) для внешности персонажа и идентичности голоса и Gemma 3 (12B IT) в качестве текстового энкодера. Пайплайн reference-to-video принимает текстовый промпт, опциональное условие первого кадра и до семи упорядоченных референсных слотов памяти на шот и поставляется с профилями для потребительских GPU через layer-wise DiT offload и тайловое декодирование Video VAE. Веса выпущены в BF16, FP8 и FP4 на основной ветке open-source репозитория под LTX-2 Community License.

Почему это важно

Первая open-weights модель аудиовизуальной генерации минутной длины с явными слотами памяти персонажа и голоса — напрямую бьёт по use case «persistent story», который Veo 3.1, модели уровня Sora и Wan 3.0 оставляют открытым, и работает в связке с Director Agent для оркестрированных много-шотных пайплайнов.

Важность: 5/5

flagship release; official confirmation; 5 sources

Источники