NeoHorse-1: рекурсивное самоулучшение через агентное пост-обучение

TokenRhythm

исследования официальный 2 ист. ~1 мин

Семейство агентно-нативных моделей, обученных через agentic post-training: гетерогенный пул моделей с интеллектуальной маршрутизацией записывает полные взаимодействия в контексте harness, превращает их в обучающие данные и замыкает цикл «оценка — отбор — обновление» в сторону рекурсивного самоулучшения, опосредованного harness. Сигналы маршрутизации организуют трёхэтапный SFT-куррикулум плюс управляемую маршрутизацией on-policy дистилляцию; пост-обучение поднимает macro-average с 58.94 до 64.87 при 4B, сокращая разрыв с базовой моделью 9B.

Почему это важно

367 апвоутов на HF Daily Papers (9 сентября) — самая популярная статья дня. Конкретный открытый (open-weights) механизм RSI, где система превращает собственные трассы маршрутизированных взаимодействий в следующий раунд обучения, с опубликованным кодом и чекпоинтами.

Важность: 4/5

Заметная статья + 367 апвоутов на HF Daily Papers; рекурсивное самоулучшение с открытыми весами

Источники

официальный arXiv 2609.08183