Beyond Euclidean Clipping: преодоление коллапса исследования в LLM RL через риманову изометрическую оптимизацию политики
Показывает, что алгоритмы в стиле PPO-Clip, применяемые в RL для LLM, страдают от 'коллапса исследования' из-за несоответствия евклидового клиппинга истинной геометрии пространства политик, и предлагает RIPO (Riemannian Isometric Policy Optimization), которая учитывает эту геометрию для лучшего баланса между исследованием и эксплуатацией, показывая улучшение до 60% над GRPO на AIME24.
Почему это важно
Затрагивает ключевую слабость рецептов RL в стиле GRPO, ставших стандартом для обучения рассуждающих LLM, с крупным заявленным приростом на широко используемом бенчмарке математических рассуждений (AIME24).
Важность: 3/5
Заметный исследовательский релиз с крупным заявленным приростом на бенчмарке относительно стандартного GRPO.