Language Models Can Control Their Own Attention

исследования официальный 1 ист. ~1 мин

Declarative Attention позволяет модели объявлять в chain-of-thought, где ей нужно внимание (глобальное, фокусное или локальное), а инференс-движок трактует эти объявления как tool calls, пропуская большинство чтений KV-кэша. Zero-shot на 15 long-context задачах с Gemma-4-31B и Qwen-3.6-27B метод сокращает обрабатываемые вниманием токены на 52% и 31% при потерях точности 1,3–2,8 п.п., уменьшающихся с ростом масштаба.

Почему это важно

Переводит разрежение KV-кэша из задачи внешнего скоринга в модельно-объявленную — управление вниманием за O(1) на шаг с готовыми моделями, без обучения.

Важность: 2/5

Заметная статья: разрежение KV-кэша без обучения через объявленный моделью охват внимания

Источники