Dream-RSI: рекурсивное самоулучшение через эволюционирующие миры
Накопленная история открытий агента превращается в симулятор реплеев, в котором обучается политика исследования («сновидение»), давая дешёвую off-policy обратную связь вместо дорогих онлайн-прогонов. Улучшенная политика возвращается в работу для новых открытий, расширяющих симулятор, замыкая цикл рекурсивного самоулучшения как ненавязчивый слой оркестрации поверх неизменного кодинг-агента.
Почему это важно
263 апвоута на HF Daily Papers; конкурентное или лучшее качество открытий при меньших затратах в инженерии алгоритмов, математической оптимизации и инженерии GPU-ядер.
Важность: 4/5
Заметная статья + 263 апвоута на HF Daily Papers (+1 бамп)