Miles v0.1: RL-система пост-обучения продакшен-уровня

RadixArk

исследования официальный 2 ист. ~1 мин

Полностековая open-source система для frontier RL post-training, построенная на дизайне slime: rollout-движки SGLang, тренеры Megatron-LM или PyTorch FSDP, три транспорта синхронизации весов, плюс поддержка LoRA RL, on-policy дистилляции и диффузионных моделей. Кейс: полностью асинхронное агентное RL на модели GLM-5.2 744B-A40B по задачам программирования с использованием терминала на 64 GPU GB300, медианное время шага 263 с.

Почему это важно

2.7k звёзд на GitHub за несколько дней; делает агентное RL масштаба frontier воспроизводимым вне frontier-лабораторий, с первым детальным публичным отчётом об агентном RL-запуске на 744B.

Важность: 3/5

2.7k звёзд на GitHub; первые публичные детали агентного RL-запуска масштаба 744B

Источники

официальный arXiv 2609.08368