#harness
- StateM: масштабирование harness поднимает GPT-5.6 Sol до 95,3% на Terminal-Bench 2.1, и тот же harness адаптируется к DeepSeek-V4 Flash при общих затратах $15 research
- DarwinX: эволюция агентских харнесов через естественный отбор Salesforce AI Research research
- AutoSaddler: автоматическая оптимизация харнесса с устойчивыми обновлениями по трассам исполнения агента Microsoft research
- DarwinX: эволюция каркасов агентов посредством естественного отбора Salesforce AI Research research
- Prime Agent: самоулучшающийся RLM-харнесс Prime Intellect research