RRSI: регуляризованное рекурсивное самоулучшение агентных каркасов
Google Research
Самоулучшение каркаса (автоэволюция промптов, управляющей логики и инструментария вокруг замороженной модели) регулярно переобучается под тренировочные задачи. RRSI добавляет регуляризацию: временно отжигаемый бюджет правок для proposer'а, а также селектор с критиком, отфильтровывающим привязанные к бенчмарку предложения, и прунером, отбрасывающим малополезные изменения.
Почему это важно
До +4.7 пункта на out-of-distribution-бенчмарках и на 30% меньше policy-токенов — самоулучшающиеся агентные каркасы способны обобщать, а не просто запоминать сплит эволюции.
Важность: 3/5
Заметная статья из Google Research с открытым кодом
Источники
вторичный
HuggingFace Daily Papers — RRSI
официальный
RRSI code (google-research)