Agentic ESOpt: файнтюн long-horizon LLM-агентов с минимальными требованиями к GPU
National University of Singapore (Zhi Zheng, Wee Sun Lee et al.)
Заменяет RL на evolution strategies для файнтюна long-horizon LLM-агентов, требуя только inference-уровневую GPU-память и поддерживая credit assignment на уровне траекторий. На WebArena-Lite улучшает агента на Qwen-3.5-27B на 6.69 пункта относительно No-Skill baseline и побеждает в 28 из 36 настроек automatic-heuristic-design на тесте.
Почему это важно
96 HF upvotes (19 августа) — предлагает жизнеспособный путь для академических лабораторий файнтюнить агентные политики frontier-масштаба на commodity GPU, обходя стоимость инфраструктуры агентного RL.
Важность: 2/5
default
Источники
официальный
arXiv — Agentic ESOpt paper
официальный
HuggingFace Daily Papers — Agentic ESOpt