Molt: масштабируемый PyTorch-native фреймворк для обучения агентного reinforcement learning

NVIDIA

исследования офиц. + СМИ 3 ист. ~1 мин

NVIDIA открывает исходный код Molt — асинхронной RL-системы обучения на базе PyTorch, спроектированной так, чтобы оставаться достаточно компактной и понятной для одного исследователя, при этом сохраняя пропускную способность на уровне стеков на основе Megatron. Система поддерживает мультимодальные политики и политики на основе mixture-of-experts, а также обеспечивает on-policy обучение, никогда не обучаясь на токене, который текущая политика не сгенерировала. Используется Ray для размещения/асинхронных очередей, vLLM для rollout и NVIDIA AutoModel + FSDP2 для обучения.

Почему это важно

Самая рейтинговая статья на HuggingFace Daily Papers за 27.07.2026 с 605 голосами — это отражает высокий интерес сообщества к упрощению инфраструктуры агентного RL в масштабе; выходит как open-source репозиторий (NVIDIA-NeMo/labs-molt), а не только как статья.

Важность: 3/5

Самая рейтинговая статья дня на HF Daily (605 голосов, значительно выше порога в 100 голосов для бампа) плюс open-source инфраструктурный релиз.

Источники