#self-improvement
- OpenAI представила GPT-Red — внутреннюю модель для автоматизированного red-teaming защиты от prompt-injection OpenAI research
- DarwinX: эволюция агентских харнесов через естественный отбор Salesforce AI Research research
- Ouroboros: самостоятельно развивающийся кодинг-агент, эволюционирующий через проверяемые коммиты research
- Repo-To-Skill: дистилляция GitHub-репозиториев в переиспользуемые AI-скиллы research
- NeoHorse-1: рекурсивное самоулучшение через агентное пост-обучение TokenRhythm research
- Dream-RSI: рекурсивное самоулучшение через эволюционирующие миры Google research
- Ctx2Skill: фреймворк самосовершенствования для автономного обнаружения навыков из контекста в LLM research
- Frontis-MA1: обучение модели AI4AI для рекурсивного самоулучшения в машинном обучении Horizon Research, Frontis.AI, Tsinghua University research
- Progressive Agent Skill Generation via Reinforcement Learning (Skill-α) The Chinese University of Hong Kong research
- On-Policy Self-Distillation without Any Supervision research
- Macaron-V1: к открытому непрерывному обучению с самосовершенствованием и Mixture-of-LoRA research
- Zetta ζ: эффективный closed-loop embodied-каркас для самоэволюционирующего физического интеллекта Air Embodied Brain (multi-institution, 15 authors) research
- Рекурсивное самосовершенствование в ИИ: обзор 1250 статей с таксономией по силе верификации research
- KnowAct-GUIClaw: самообучающаяся память и библиотека навыков для кросс-платформенных GUI-агентов Harbin Institute of Technology research
- Recursive Harness Self-Improvement (RHI): доработка агентных «обвязок» по обратной связи от выполнения Sakana AI research
- AREX: к рекурсивно самосовершенствующемуся агенту для глубоких исследований Beijing Academy of Artificial Intelligence (BAAI) research
- От RLVR к RLSVR: преобразование задач порождает самопроверяемые вознаграждения для самосовершенствования LLM в открытых доменах research
- Macaron-V1: к открытому непрерывному обучению с самоулучшением и Mixture-of-LoRA Mind Lab research
- Действительно ли on-policy дистилляция дистиллирует? Безучительская OPSA обгоняет её на AIME24 Purdue University research
- Обзор: масштабирование reasoning-моделей за пределами человеческой супервизии по пятиуровневой лестнице автономии research
- FlowBalance: самосовершенствование reasoning-моделей с опорой на верификатор research