Uno: lossless-ускорение LLM через диффузионно-аугментированную авторегрессию
MBZUAI
Диффузионно-аугментированные LLM разделяют параметры на стандартные веса next-token плюс лёгкие диффузионные головы, обученные выдавать несколько токенов параллельно, добавляемые через фазу дистилляции с минимальными накладными расходами пайплайна. Сопутствующие сэмплеры Psi-Spec дают lossless-ускорение без draft-модели, а 8B-версия Uno обгоняет speculative decoding при любом размере батча с ускорениями до 3x, превосходя 26B DiffusionGemma и Mercury 2. Код и чекпойнты выложены.
Почему это важно
112 апвоутов на HF Daily Papers; правдоподобная drop-in-альтернатива speculative decoding, сохраняющая AR-качество при параллельном декодировании.
Важность: 4/5
Заметная статья, 112 апвоутов на HF Daily Papers (применён бамп); код и чекпойнты выложены