LLaDA-Image: сильный генератор изображений с полностью открытым тренировочным рецептом
inclusionAI (Ant Group)
Генератор изображений на 6B Diffusion Transformer, обученный с нуля, в паре с замороженным vision-language-модулем на базе диффузионной языковой модели LLaDA2.0-Mini, обученный на пайплайне из 220 млн примеров с RMSNorm и оптимизатором Muon. Визуальный генеративный прайор строится через pre-training и mid-training только на изображениях, а не на парных image-text-данных; дистиллированный вариант Turbo генерирует за 2–4 шага. Заявлен SOTA среди открытых моделей на Qwen-Image-Bench (53.53 EN / 53.38 ZH) с опубликованными весами и полными тренировочными рецептами.
Почему это важно
226 апвоутов в HF Daily Papers 4 сентября — первый полностью открытый рецепт обучения с нуля для конкурентоспособного открытого генератора изображений
Важность: 4/5
заметная статья (3) + ≥100 апвоутов в HF Daily Papers (+1)