Understanding Evolution Strategies для рассуждений LLM: более широкое покрытие рассуждений, чем у GRPO

исследования официальный 2 ист. ~1 мин

Авторы обосновывают, что Evolution Strategies — самостоятельная парадигма пост-тренинга для рассуждений LLM, а не лишь экономящая память замена GRPO: ES достигает большего разнообразия рассуждений (Jensen-Shannon diversity, спроецированная через верификатор, коррелирует с Pass@K), улучшает Pass@1 и превосходит GRPO по Pass@K без коллапса энтропии, а её выигрыши приходят из разреженного подмножества обновлений параметров высокой амплитуды, что говорит об отсутствии катастрофического забывания. Предложен последовательный график GRPO-ES, сочетающий оба подхода.

Почему это важно

ES позиционируется как первоклассная альтернатива RLVR с лучшим покрытием Pass@K

Важность: 2/5

свежий дроп на arXiv, скромный отклик (15 апвоутов)

Источники

официальный arXiv 2608.27351
официальный HF Papers — 15 upvotes, Aug 28