От RLVR к RLSVR: преобразование задач порождает самопроверяемые вознаграждения для самосовершенствования LLM в открытых доменах
Предлагается RLSVR — метод, преобразующий открытые задачи (суммаризация, творческое письмо) в верифицируемые прокси-среды, так что сигналы вознаграждения возникают автоматически, без опоры на человеческие предпочтения или LLM-судей. Реализовано в виде SpyRL — мультиагентной игры с самообучением, где результаты голосования дают верифицируемые с точностью до истины вознаграждения; показано улучшение как на неверифицируемых, так и на верифицируемых задачах рассуждения.
Почему это важно
Расширяет парадигму RLVR (ранее ограниченную математикой/кодом с детерминированными проверяющими) на открытые домены без предвзятости модели-судьи и дополнительных затрат на инференс.
Важность: 2/5
Заметная исследовательская статья по RL, только официальный источник arxiv/HF; 38 апвоутов на HF Daily Papers, ниже порога буста в 100 апвоутов.