Rethinking On-Policy Distillation of LLMs II: почти полные выгоды с одного тренировочного примера
Работа доводит on-policy distillation до предела минимума данных: обучение на одном запросе продолжает улучшать модель сотни шагов и восстанавливает большую часть выгод OPD на полных данных. Механизм — покрытие состояний: один запрос уже достигает 71,5% состояний, посещаемых OPD на полных данных, а 16 разнообразных запросов — 98,9%. Вывод: OPD «перекормлена данными, но недокормлена алгоритмически» — эффективность шагов, а не количество данных, является настоящим узким местом.
Почему это важно
переосмысляет бюджеты данных для дистилляции: почти полные выгоды с горстки запросов
Важность: 2/5
заметная follow-up-статья; ниже порога в 100 апвоутов для буста