FlowBalance: самосовершенствование reasoning-моделей с опорой на верификатор
Метод самосовершенствования, обучающий нормализованное распределение по полным ответам: замороженная на этапе обучения политика выдаёт приросты лог-вероятностей на уровне токенов, агрегируемые в траекторный скор self-guidance и калибруемые против группового преимущества, выведенного из верификатора. Метод обгоняет FlowRL на математическом reasoning с Qwen3-4B/8B, обучается быстрее и стабильнее и избегает коллапса длины ответов прямой on-policy самодистилляции.
Почему это важно
81 апвоут на HF Daily Papers; конкретный рецепт, как сделать хрупкий цикл on-policy самосовершенствования стабильным без плотной человеческой разметки.
Важность: 2/5
Добротная статья по методам, 81 апвоут на HF Daily Papers, ниже порога бампа в 100 апвоутов
Источники
официальный
HuggingFace Daily Papers: FlowBalance