SLAI T-Rex: полнопараметрическое пост-обучение семейства DeepSeek-V4 на Ascend SuperPOD
SLAI
Сообщается о полнопараметрическом пост-обучении моделей mixture-of-experts DeepSeek-V4 с триллионом параметров на кластерах NPU Huawei Ascend вместо GPU, с достижением 34,22% утилизации FLOPs модели (в 2,93 раза выше открытого базового рецепта) за счёт иерархического параллелизма и оптимизации на уровне ядер, а также использованием полученной инфраструктуры для обучения специализированной модели для исследования операций, достигающей 71,81% zero-shot Pass@1.
Почему это важно
Демонстрирует, что пост-обучение LLM триллионного масштаба уже практически осуществимо вне экосистемы Nvidia GPU — значимая веха для инфраструктурной независимости незападных вычислений для ИИ.
Важность: 3/5
Заметный исследовательский релиз: инфраструктурная веха пост-обучения триллионного масштаба.