#rlhf
- Apodex 1.1: масштабирование агентного интеллекта для сложных задач Apodex research
- OpenAI раскрывает, как сигнал вознаграждения для 2,5% пользователей вызвал гоблинскую одержимость GPT на протяжении нескольких поколений моделей OpenAI research
- Разбор инцидента OpenAI: как RLHF reward hacking встроил гоблинские метафоры в GPT-5.x OpenAI research
- Annotations as Rollouts: эффективный и масштабируемый reinforcement learning для видео-MLLM research
- Z-Reward: распределения оценок вместо скалярных наград для RLHF в генерации изображений Alibaba research
- Переосмысливая обучение критика в PPO: понимание и смягчение Value Flattening Shanghai AI Laboratory research
- NudgeRL: стратегические контекстные подсказки для эффективного исследования в RLVR KAIST AI research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- Tencent Hunyuan публикует в открытый доступ UniRL: унифицированное RL-дообучение для LLM и диффузионных моделей Tencent / Hunyuan research
- TRL v1.11.0 переписывает trl vllm-serve (~в10 раз меньше кода) и выпускает AsyncDistillationTrainer Hugging Face tools