Понимание рассуждения: от предобучения к пост-обучению
Используя шахматы как контролируемый тестовый стенд, охватывающий весь пайплайн от предобучения до RL, авторы показывают, что RL-пост-обучение не просто «затачивает» обученную с учителем политику: на лёгких задачах оно усиливает ходы, которые модель уже предпочитала, а на сложных — выявляет правильные ходы, почти отсутствовавшие после SFT, причём модели с более долгим предобучением получают больше пользы от RL.
Почему это важно
Представлена на HuggingFace Daily Papers 2026-07-20 с 20 голосами; даёт механистическое объяснение того, что именно RL-пост-обучение меняет в политике модели, связывая масштаб предобучения с отдачей от RL.
Важность: 2/5
Механистическое исследование RL-пост-обучения на контролируемом стенде, ниже порога для бонуса за голоса.