RRSI: регуляризованное рекурсивное самоулучшение агентных каркасов

Google Research

исследования официальный 3 ист. ~1 мин

Самоулучшение каркаса (автоэволюция промптов, управляющей логики и инструментария вокруг замороженной модели) регулярно переобучается под тренировочные задачи. RRSI добавляет регуляризацию: временно отжигаемый бюджет правок для proposer'а, а также селектор с критиком, отфильтровывающим привязанные к бенчмарку предложения, и прунером, отбрасывающим малополезные изменения.

Почему это важно

До +4.7 пункта на out-of-distribution-бенчмарках и на 30% меньше policy-токенов — самоулучшающиеся агентные каркасы способны обобщать, а не просто запоминать сплит эволюции.

Важность: 3/5

Заметная статья из Google Research с открытым кодом

Источники

официальный RRSI code (google-research)