Language Models Can Control Their Own Attention
Declarative Attention позволяет модели объявлять в chain-of-thought, где ей нужно внимание (глобальное, фокусное или локальное), а инференс-движок трактует эти объявления как tool calls, пропуская большинство чтений KV-кэша. Zero-shot на 15 long-context задачах с Gemma-4-31B и Qwen-3.6-27B метод сокращает обрабатываемые вниманием токены на 52% и 31% при потерях точности 1,3–2,8 п.п., уменьшающихся с ростом масштаба.
Почему это важно
Переводит разрежение KV-кэша из задачи внешнего скоринга в модельно-объявленную — управление вниманием за O(1) на шаг с готовыми моделями, без обучения.
Важность: 2/5
Заметная статья: разрежение KV-кэша без обучения через объявленный моделью охват внимания
Источники
официальный
Language Models Can Control Their Own Attention