Beyond Euclidean Clipping: преодоление коллапса исследования в LLM RL через риманову изометрическую оптимизацию политики

исследования официальный 2 ист. ~1 мин

Показывает, что алгоритмы в стиле PPO-Clip, применяемые в RL для LLM, страдают от 'коллапса исследования' из-за несоответствия евклидового клиппинга истинной геометрии пространства политик, и предлагает RIPO (Riemannian Isometric Policy Optimization), которая учитывает эту геометрию для лучшего баланса между исследованием и эксплуатацией, показывая улучшение до 60% над GRPO на AIME24.

Почему это важно

Затрагивает ключевую слабость рецептов RL в стиле GRPO, ставших стандартом для обучения рассуждающих LLM, с крупным заявленным приростом на широко используемом бенчмарке математических рассуждений (AIME24).

Важность: 3/5

Заметный исследовательский релиз с крупным заявленным приростом на бенчмарке относительно стандартного GRPO.

Источники