Editable Visual Design: кодинг-агенты генерируют слоистые HTML/CSS-визуалы вместо сплющенных картинок
Команда вокруг Junyan Ye предлагает новую парадигму генерации визуала, где кодинг-агент использует VLM как творческий мозг, а имидж-модель — как симулятор визуального мира по запросу: агент генерирует изолированные ассеты, пишет нативный HTML/CSS и доводит дизайн по отрендеренной обратной связи. Результат — редактируемые артефакты с развязанными слоями, в отличие от end-to-end-вывода диффузионных моделей (GPT-Image-2, Nano Banana), дающего сплющенные битмапы с ошибками в тексте.
Почему это важно
Самая раскрученная статья чарта HF от 5 сентября (42 апвота); указывает на направление «после имидж-редакторов», где дизайны остаются структурированными и редактируемыми, а не запекаются в пиксели.
Важность: 2/5
Вершина уикендного чарта HF Daily Papers, ниже планки в 100 апвотов
Источники
официальный
Editable Visual Design (arXiv)