Skill Self-Play: расширение границ возможностей LLM с помощью совместно эволюционирующих навыков
Alibaba
Команда Qwen в Alibaba предложила Skill-SP — фреймворк обучения с подкреплением с тремя совместно эволюционирующими компонентами: proposer, генерирующий задачи с учётом динамически выбираемых навыков, solver, исследующий решения, и skill controller, обновляющий библиотеку навыков на основе обратной связи от выполнения. Цель — соединить надёжное, но узкое обучение в рамках среды с широкой, но менее надёжной генерацией открытых задач; показаны улучшения на бенчмарках по использованию инструментов и рассуждению, включая значительный прирост для изначально слабых моделей.
Почему это важно
Заняла 2-е место в Hugging Face Daily Papers с 38 апвоутами; работа решает реальное противоречие в текущих пайплайнах обучения агентов между верифицируемыми узкими задачами и разнообразными, но зашумлёнными самогенерируемыми.
Важность: 2/5
Заметное исследование в области RL/агентного обучения; 2-е место в HF Daily Papers.