The Tasteful Agent: измерение «вкуса» в задачах длинного горизонта

Microsoft

исследования официальный 2 ист. ~1 мин

Представлен Taste-Bench: вопросы на развилках решений, автоматически извлечённые из реальных траекторий агентов (параллельные попытки и обходы внутри траектории, без ручной разметки), — они измеряют, выбирает ли агент верную ветку до того, как увидит результат. Лучшая frontier-модель набирает лишь 59,7%; развилки с отложенными свидетельствами даются значительно труднее, а «вкус» улучшается дистилляцией оценки учителя, знающего исход, что поднимает end-to-end успех на held-out SWE-bench Pro.

Почему это важно

111 апвотов на HF Daily (23.09); новая ось оценки качества агента за пределами итоговой точности.

Важность: 4/5

Заметная статья со 100+ апвотами HF Daily

Источники