#agentic-rl
- Apodex 1.1: масштабирование агентного интеллекта для сложных задач Apodex research
- IBM выпускает reasoning-LLM Granite 4.2 (3B/8B/30B, Apache 2.0, контекст 512K), обученные на ~15T токенов с GRPO RL на GB200 NVL72 IBM models-llm
- Apodex 1.1: масштабирование агентского интеллекта для сложной работы Apodex AI research
- OPID: дистилляция навыков на собственной политике улучшает RL агентов с длинным горизонтом Institute of Automation, Chinese Academy of Sciences research
- EnvHarness: Awakening Static Worlds for Agent Learning Google research
- Горизонт верификации: ни одна функция вознаграждения не работает для агентов программирования при масштабировании Qwen (Alibaba) research
- AgentOPSD: рекурсивная самодистилляция для агентного обучения с подкреплением research