Skill Self-Play: расширение границ возможностей LLM с помощью совместно эволюционирующих навыков

Alibaba

исследования официальный 2 ист. ~1 мин

Команда Qwen в Alibaba предложила Skill-SP — фреймворк обучения с подкреплением с тремя совместно эволюционирующими компонентами: proposer, генерирующий задачи с учётом динамически выбираемых навыков, solver, исследующий решения, и skill controller, обновляющий библиотеку навыков на основе обратной связи от выполнения. Цель — соединить надёжное, но узкое обучение в рамках среды с широкой, но менее надёжной генерацией открытых задач; показаны улучшения на бенчмарках по использованию инструментов и рассуждению, включая значительный прирост для изначально слабых моделей.

Почему это важно

Заняла 2-е место в Hugging Face Daily Papers с 38 апвоутами; работа решает реальное противоречие в текущих пайплайнах обучения агентов между верифицируемыми узкими задачами и разнообразными, но зашумлёнными самогенерируемыми.

Важность: 2/5

Заметное исследование в области RL/агентного обучения; 2-е место в HF Daily Papers.

Источники

официальный Paper page - Skill Self-Play