SMELT: зацикленные MoE-трансформеры догоняют базовое масштабирование при равных вычислениях

ByteDance Seed

исследования офиц. + СМИ 2 ист. ~1 мин

Опубликованная 1 сентября (arXiv 2609.01343) работа авторов ByteDance Seed исследует зацикливание слоёв в разреженных MoE-трансформерах при строгом совпадении FLOPs на токен, не-эмбеддинговых параметров и KV-кэша с незацикленным бейзлайном. Полученный рецепт, SMELT, удваивает среднюю половину слоёв и масштабировался на четырёх размерах до 54B не-эмбеддинговых параметров с подгонкой Chinchilla-подобного закона масштабирования под каждую архитектуру; он экономит 6,8–18% обучающих FLOPs на compute-оптимальном фронте, а механистический анализ показывает, что второй проход цикла уменьшает attention-sink массу и перенаправляет её на содержательно значимые токены.

Почему это важно

Зацикленные MoE могут дать дополнительную эффективную глубину бесплатно при фиксированных вычислениях

Важность: 2/5

Заметное исследование масштабирования архитектуры с механистическим анализом

Источники