#tool-use
- MobilePA-Bench: бенчмаркинг мобильных планировщиков-агентов на сложных реальных задачах research
- LongHorizon-Harness: развитие агентов для долгих горизонтов в реальных задачах research
- IBM выпускает reasoning-LLM Granite 4.2 (3B/8B/30B, Apache 2.0, контекст 512K), обученные на ~15T токенов с GRPO RL на GB200 NVL72 IBM models-llm
- Apodex 1.1: масштабирование агентского интеллекта для сложной работы Apodex AI research
- Prime Agent: самоулучшающийся RLM-харнесс Prime Intellect research
- Agent Memory Distillation: усиление малых LLM-агентов иерархической памятью учителя research