TRL v1.11.0 переписывает trl vllm-serve (~в10 раз меньше кода) и выпускает AsyncDistillationTrainer

Hugging Face

инструменты официальный 1 ист. ~1 мин

v1.11.0 (26 авг.) оборачивает собственный сервер vLLM внутри `trl vllm-serve` (~130 строк вместо прежних 1218), показано ~1.5x ускорение на GRPO server-mode бенчмарках. Новый экспериментальный AsyncDistillationTrainer с поддержкой multi-teacher MOPD; DistillationTrainer получает tool calling; новая поддержка моделей/шаблонов Muse Glimmer, Nemotron 3.5 Lightning, LFM2.5-VL, Qwen3.8 и DeepSeek-R1-Distill chat template; исправление нормализатора DAPO/CISPO/VESPO на пути Liger; исправления VLM для GRPO/RLOO. v1.12.0 был случайным дубликатом и пропущен.

Почему это важно

Переписывание vllm-serve радикально сокращает поверхность поддержки тренеров GRPO/RLOO, а ускорение показывает цену прежнего кастомного сервера; AsyncDistillationTrainer добавляет multi-teacher путь, важный для исследований Mixture-of-Teachers.

Важность: 2/5

default

Источники

официальный TRL v1.11.0 release