#training-dynamics
- Мираж оптимизации политик обучения: монотонные политики инференса как реальная цель для RL языковых моделей Tianjin University / Alibaba research
- Super Weights в LLM: почему высокосалиентные параметры не работают как цели дообучения Amazon research
- О геометрии on-policy дистилляции: парадигма обучения, отличная от SFT и RLVR Hong Kong University of Science and Technology research
- Плотного надзора недостаточно: слепое пятно считывания в зациклённых языковых моделях research
- RL-дообучение активно формирует стратегии композиционного рассуждения, а не просто усиливает базовые навыки research