Random Attention: переосмысление вытеснения KV-кэша для эффективного рассуждения

Salesforce AI Research

исследования официальный 2 ист. ~1 мин

Провокационный негативный результат: изощрённое скорирование важности для вытеснения KV-кэша в основном не нужно. Сохранение промпта нетронутым и равномерное случайное вытеснение токенов рассуждения внутри каждого attention-голова совпадает с сильнейшим предшествующим вытеснителем на четырёх моделях и шести задачах рассуждения, при этом обеспечивая на 32–43% выше пропускную способность в vLLM. Трейс рассуждения защищает себя сам — модель переформулирует нужную информацию в тексте, и каждая голова хранит свою копию.

Почему это важно

158 апвоутов на HF Daily Papers. Переосмысляет целое направление работ по KV-компрессии: выигрыши прежних селекторов в основном шли от случайного сохранения промпта, а не от умного скорирования — а случайное вытеснение ничего не стоит.

Важность: 4/5

Заметная статья + 158 апвоутов на HF Daily Papers

Источники