DataFlex-RL: оценочная платформа показала, что политики отбора данных для RLVR не превосходят равномерный сэмплинг

Peking University

исследования офиц. + СМИ 2 ист. ~1 мин

Контролируемая оценочная платформа сравнила 13 конфигураций политик отбора данных для RLVR на общем рецепте GRPO (Qwen2.5-7B-Base и Llama-3.1-8B-Base, 12 совпадающих сидов, 12 бенчмарков). Ни один метод отбора роллаутов, перевзвешивания или адаптивного смешивания доменов не дал воспроизводимого улучшения против равномерного GRPO, а пересчёт масштабов подмножеств бенчмарков менял ранжирование с корреляцией −0,33.

Почему это важно

Аккуратный негативный результат против популярного исследовательского направления: изощрённые политики курирования данных, широко используемые в RLVR-пайплайнах, не дают воспроизводимого выигрыша против простого равномерного сэмплинга при корректных сидах и контроле.

Важность: 3/5

Аккуратный негативный результат против популярного исследовательского направления; топ-статья дня на HF Daily

Источники