WarpSAC: на пути к вершине масштабируемого off-policy RL через переосмысление исследования и эксплуатации
Диагностирует, что стабилизаторы off-policy (нормализация параметров, clipped double-Q) зависят от режима данных, и предлагает WarpSAC — семейство off-policy RL-алгоритмов, учитывающих режим, с Sample Weight Decay и age-biased replay. Заявлены +4.5% AUC относительно FlashSAC на 9 CPU-scale средах и +23.1% на 14 GPU-parallel средах.
Почему это важно
HF Daily Papers за 27 августа — 134 апвоута; даёт drop-in путь апгрейда для массивно параллельного обучения off-policy RL с отдельными вариантами для CPU-scale режима с ограниченными данными и GPU-scale режима с избытком данных.
Важность: 3/5
notable release; official+media confirmation; HF Daily 134 upvotes
Источники
официальный
HF Daily Papers: WarpSAC (134 upvotes)