Переосмысливая обучение критика в PPO: понимание и смягчение Value Flattening
Shanghai AI Laboratory
Статья выявляет «Value Flattening» у PPO-критиков в LLM RL: истинные значения состояний резко меняются между промежуточными токенами, тогда как предсказания критика остаются плоскими; причина — неявный штраф на дисперсию в лоссе критика плюс избыточные градиенты от временно коррелированных состояний. Предлагаемое решение, SP3O (Sparse PPO), обучает value-лосс только примерно на трёх хорошо разделённых состояниях на ответ и стабильно улучшает обучение политики на моделях Qwen3-Base разных размеров.
Почему это важно
60 апвотов на HF Daily Papers; чистая диагностика ключевой нестабильности PPO-пост-трейнинга LLM с почти бесплатным фиксом, актуально всем, кто гоняет RLVR-пайплайны.
Важность: 3/5
Заметная исследовательская работа о ключевой нестабильности LLM RL