Understanding Evolution Strategies для рассуждений LLM: более широкое покрытие рассуждений, чем у GRPO
Авторы обосновывают, что Evolution Strategies — самостоятельная парадигма пост-тренинга для рассуждений LLM, а не лишь экономящая память замена GRPO: ES достигает большего разнообразия рассуждений (Jensen-Shannon diversity, спроецированная через верификатор, коррелирует с Pass@K), улучшает Pass@1 и превосходит GRPO по Pass@K без коллапса энтропии, а её выигрыши приходят из разреженного подмножества обновлений параметров высокой амплитуды, что говорит об отсутствии катастрофического забывания. Предложен последовательный график GRPO-ES, сочетающий оба подхода.
Почему это важно
ES позиционируется как первоклассная альтернатива RLVR с лучшим покрытием Pass@K
Важность: 2/5
свежий дроп на arXiv, скромный отклик (15 апвоутов)
Источники
официальный
arXiv 2608.27351
официальный
HF Papers — 15 upvotes, Aug 28