Dream-RSI: рекурсивное самоулучшение через эволюционирующие миры

Google

исследования официальный 2 ист. ~1 мин

Накопленная история открытий агента превращается в симулятор реплеев, в котором обучается политика исследования («сновидение»), давая дешёвую off-policy обратную связь вместо дорогих онлайн-прогонов. Улучшенная политика возвращается в работу для новых открытий, расширяющих симулятор, замыкая цикл рекурсивного самоулучшения как ненавязчивый слой оркестрации поверх неизменного кодинг-агента.

Почему это важно

263 апвоута на HF Daily Papers; конкурентное или лучшее качество открытий при меньших затратах в инженерии алгоритмов, математической оптимизации и инженерии GPU-ядер.

Важность: 4/5

Заметная статья + 263 апвоута на HF Daily Papers (+1 бамп)

Источники

официальный Dream-RSI — Hugging Face Daily Papers (syndicated from arxiv.org)