Molt: масштабируемый PyTorch-native фреймворк для обучения агентного reinforcement learning
NVIDIA
NVIDIA открывает исходный код Molt — асинхронной RL-системы обучения на базе PyTorch, спроектированной так, чтобы оставаться достаточно компактной и понятной для одного исследователя, при этом сохраняя пропускную способность на уровне стеков на основе Megatron. Система поддерживает мультимодальные политики и политики на основе mixture-of-experts, а также обеспечивает on-policy обучение, никогда не обучаясь на токене, который текущая политика не сгенерировала. Используется Ray для размещения/асинхронных очередей, vLLM для rollout и NVIDIA AutoModel + FSDP2 для обучения.
Почему это важно
Самая рейтинговая статья на HuggingFace Daily Papers за 27.07.2026 с 605 голосами — это отражает высокий интерес сообщества к упрощению инфраструктуры агентного RL в масштабе; выходит как open-source репозиторий (NVIDIA-NeMo/labs-molt), а не только как статья.
Важность: 3/5
Самая рейтинговая статья дня на HF Daily (605 голосов, значительно выше порога в 100 голосов для бампа) плюс open-source инфраструктурный релиз.