Обзор: масштабирование reasoning-моделей за пределами человеческой супервизии по пятиуровневой лестнице автономии
72-страничная position paper 19 авторов описывает, как большие reasoning-модели могут продолжать улучшаться по мере угасания человеческого надзора, выстраивая прогресс по оси вознаграждения (от человеческих оценок к переиспользуемым автоматическим верификаторам) и оси опыта (от человеческих задач к самогенерируемым программам обучения). Предложена лестница L0–L4 автономности обучающего цикла и названы растущие риски: reward hacking, дрейф обратной связи, коллапс учебной программы и ошибки среды.
Почему это важно
15 апвоутов на HF Daily Papers за 1 сентября; даёт полю общий словарь для перехода от человечески размеченных данных к самоподдерживающимся обучающим циклам.
Важность: 2/5
Заметная position paper на HF Daily Papers (15 апвоутов), официальные источники