Tencent Hunyuan открывает SAS — маршрутизаторы разреженного внимания, обученные end-to-end на Qwen3
Tencent Hunyuan
Команда Tencent Hunyuan выпустила Simple Attention Sparsification (SAS) — метод gated разреженного внимания, который обучается ранжировать и выбирать KV-блоки через непрерывные гейты, оптимизируемые end-to-end с лоссом языкового моделирования, вместо дистилляции оценок плотного внимания. Чекпойнты только маршрутизаторов (33–42 млн параметров гейтов) для Qwen3-4B/8B/14B выложены на Hugging Face 14 сентября вместе с совместимым с SGLang бэкендом seer_attn и статьёй arXiv 2609.13141.
Почему это важно
Недифференцируемость жёсткого Top-K выбора — ключевая проблема обучаемого разреженного внимания; SAS выравнивает ранжирование контекста напрямую с влиянием на предсказание при фиксированном бюджете внимания, а дизайн замороженного бэкбона с маршрутизатором делает это дешёвым post-training дополнением для уже развёрнутых моделей Qwen3.
Важность: 3/5
Чистое решение проблемы недифференцируемости обучаемого разреженного внимания с открытыми чекпойнтами