Обзор: масштабирование reasoning-моделей за пределами человеческой супервизии по пятиуровневой лестнице автономии

исследования официальный 2 ист. ~1 мин

72-страничная position paper 19 авторов описывает, как большие reasoning-модели могут продолжать улучшаться по мере угасания человеческого надзора, выстраивая прогресс по оси вознаграждения (от человеческих оценок к переиспользуемым автоматическим верификаторам) и оси опыта (от человеческих задач к самогенерируемым программам обучения). Предложена лестница L0–L4 автономности обучающего цикла и названы растущие риски: reward hacking, дрейф обратной связи, коллапс учебной программы и ошибки среды.

Почему это важно

15 апвоутов на HF Daily Papers за 1 сентября; даёт полю общий словарь для перехода от человечески размеченных данных к самоподдерживающимся обучающим циклам.

Важность: 2/5

Заметная position paper на HF Daily Papers (15 апвоутов), официальные источники

Источники