#post-training
- DRPO: переосмысление дивергентной регуляризации в обучении с подкреплением для LLM Tencent Hunyuan research
- SLAI T-Rex: полнопараметрическое пост-обучение семейства DeepSeek-V4 на Ascend SuperPOD SLAI research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- OPRD: дистилляция представлений на политике для пост-обучения LLM research
- Tencent Hunyuan публикует в открытый доступ UniRL: унифицированное RL-дообучение для LLM и диффузионных моделей Tencent / Hunyuan research
- Обобщение от слабого к сильному через прямую on-policy дистилляцию ByteDance / Tsinghua University research
- RL-дообучение активно формирует стратегии композиционного рассуждения, а не просто усиливает базовые навыки research