TRL v1.11.0 переписывает trl vllm-serve (~в10 раз меньше кода) и выпускает AsyncDistillationTrainer
Hugging Face
v1.11.0 (26 авг.) оборачивает собственный сервер vLLM внутри `trl vllm-serve` (~130 строк вместо прежних 1218), показано ~1.5x ускорение на GRPO server-mode бенчмарках. Новый экспериментальный AsyncDistillationTrainer с поддержкой multi-teacher MOPD; DistillationTrainer получает tool calling; новая поддержка моделей/шаблонов Muse Glimmer, Nemotron 3.5 Lightning, LFM2.5-VL, Qwen3.8 и DeepSeek-R1-Distill chat template; исправление нормализатора DAPO/CISPO/VESPO на пути Liger; исправления VLM для GRPO/RLOO. v1.12.0 был случайным дубликатом и пропущен.
Почему это важно
Переписывание vllm-serve радикально сокращает поверхность поддержки тренеров GRPO/RLOO, а ускорение показывает цену прежнего кастомного сервера; AsyncDistillationTrainer добавляет multi-teacher путь, важный для исследований Mixture-of-Teachers.
Важность: 2/5
default