Uno: lossless-ускорение LLM через диффузионно-аугментированную авторегрессию

MBZUAI

исследования официальный 2 ист. ~1 мин

Диффузионно-аугментированные LLM разделяют параметры на стандартные веса next-token плюс лёгкие диффузионные головы, обученные выдавать несколько токенов параллельно, добавляемые через фазу дистилляции с минимальными накладными расходами пайплайна. Сопутствующие сэмплеры Psi-Spec дают lossless-ускорение без draft-модели, а 8B-версия Uno обгоняет speculative decoding при любом размере батча с ускорениями до 3x, превосходя 26B DiffusionGemma и Mercury 2. Код и чекпойнты выложены.

Почему это важно

112 апвоутов на HF Daily Papers; правдоподобная drop-in-альтернатива speculative decoding, сохраняющая AR-качество при параллельном декодировании.

Важность: 4/5

Заметная статья, 112 апвоутов на HF Daily Papers (применён бамп); код и чекпойнты выложены

Источники