SMELT: зацикленные MoE-трансформеры догоняют базовое масштабирование при равных вычислениях
ByteDance Seed
Опубликованная 1 сентября (arXiv 2609.01343) работа авторов ByteDance Seed исследует зацикливание слоёв в разреженных MoE-трансформерах при строгом совпадении FLOPs на токен, не-эмбеддинговых параметров и KV-кэша с незацикленным бейзлайном. Полученный рецепт, SMELT, удваивает среднюю половину слоёв и масштабировался на четырёх размерах до 54B не-эмбеддинговых параметров с подгонкой Chinchilla-подобного закона масштабирования под каждую архитектуру; он экономит 6,8–18% обучающих FLOPs на compute-оптимальном фронте, а механистический анализ показывает, что второй проход цикла уменьшает attention-sink массу и перенаправляет её на содержательно значимые токены.
Почему это важно
Зацикленные MoE могут дать дополнительную эффективную глубину бесплатно при фиксированных вычислениях
Важность: 2/5
Заметное исследование масштабирования архитектуры с механистическим анализом