Editable Visual Design: кодинг-агенты генерируют слоистые HTML/CSS-визуалы вместо сплющенных картинок

исследования официальный 2 ист. ~1 мин

Команда вокруг Junyan Ye предлагает новую парадигму генерации визуала, где кодинг-агент использует VLM как творческий мозг, а имидж-модель — как симулятор визуального мира по запросу: агент генерирует изолированные ассеты, пишет нативный HTML/CSS и доводит дизайн по отрендеренной обратной связи. Результат — редактируемые артефакты с развязанными слоями, в отличие от end-to-end-вывода диффузионных моделей (GPT-Image-2, Nano Banana), дающего сплющенные битмапы с ошибками в тексте.

Почему это важно

Самая раскрученная статья чарта HF от 5 сентября (42 апвота); указывает на направление «после имидж-редакторов», где дизайны остаются структурированными и редактируемыми, а не запекаются в пиксели.

Важность: 2/5

Вершина уикендного чарта HF Daily Papers, ниже планки в 100 апвотов

Источники

официальный Editable Visual Design (arXiv)
вторичный Editable Visual Design — Hugging Face Daily Papers (syndicated from arXiv)