NeoHorse-1: рекурсивное самоулучшение через агентное пост-обучение
TokenRhythm
Семейство агентно-нативных моделей, обученных через agentic post-training: гетерогенный пул моделей с интеллектуальной маршрутизацией записывает полные взаимодействия в контексте harness, превращает их в обучающие данные и замыкает цикл «оценка — отбор — обновление» в сторону рекурсивного самоулучшения, опосредованного harness. Сигналы маршрутизации организуют трёхэтапный SFT-куррикулум плюс управляемую маршрутизацией on-policy дистилляцию; пост-обучение поднимает macro-average с 58.94 до 64.87 при 4B, сокращая разрыв с базовой моделью 9B.
Почему это важно
367 апвоутов на HF Daily Papers (9 сентября) — самая популярная статья дня. Конкретный открытый (open-weights) механизм RSI, где система превращает собственные трассы маршрутизированных взаимодействий в следующий раунд обучения, с опубликованным кодом и чекпоинтами.
Важность: 4/5
Заметная статья + 367 апвоутов на HF Daily Papers; рекурсивное самоулучшение с открытыми весами