DataFlex-RL: оценочная платформа показала, что политики отбора данных для RLVR не превосходят равномерный сэмплинг
Peking University
Контролируемая оценочная платформа сравнила 13 конфигураций политик отбора данных для RLVR на общем рецепте GRPO (Qwen2.5-7B-Base и Llama-3.1-8B-Base, 12 совпадающих сидов, 12 бенчмарков). Ни один метод отбора роллаутов, перевзвешивания или адаптивного смешивания доменов не дал воспроизводимого улучшения против равномерного GRPO, а пересчёт масштабов подмножеств бенчмарков менял ранжирование с корреляцией −0,33.
Почему это важно
Аккуратный негативный результат против популярного исследовательского направления: изощрённые политики курирования данных, широко используемые в RLVR-пайплайнах, не дают воспроизводимого выигрыша против простого равномерного сэмплинга при корректных сидах и контроле.
Важность: 3/5
Аккуратный негативный результат против популярного исследовательского направления; топ-статья дня на HF Daily