Переосмысливая обучение критика в PPO: понимание и смягчение Value Flattening

Shanghai AI Laboratory

исследования официальный 2 ист. ~1 мин

Статья выявляет «Value Flattening» у PPO-критиков в LLM RL: истинные значения состояний резко меняются между промежуточными токенами, тогда как предсказания критика остаются плоскими; причина — неявный штраф на дисперсию в лоссе критика плюс избыточные градиенты от временно коррелированных состояний. Предлагаемое решение, SP3O (Sparse PPO), обучает value-лосс только примерно на трёх хорошо разделённых состояниях на ответ и стабильно улучшает обучение политики на моделях Qwen3-Base разных размеров.

Почему это важно

60 апвотов на HF Daily Papers; чистая диагностика ключевой нестабильности PPO-пост-трейнинга LLM с почти бесплатным фиксом, актуально всем, кто гоняет RLVR-пайплайны.

Важность: 3/5

Заметная исследовательская работа о ключевой нестабильности LLM RL

Источники