The Tasteful Agent: измерение «вкуса» в задачах длинного горизонта
Microsoft
Представлен Taste-Bench: вопросы на развилках решений, автоматически извлечённые из реальных траекторий агентов (параллельные попытки и обходы внутри траектории, без ручной разметки), — они измеряют, выбирает ли агент верную ветку до того, как увидит результат. Лучшая frontier-модель набирает лишь 59,7%; развилки с отложенными свидетельствами даются значительно труднее, а «вкус» улучшается дистилляцией оценки учителя, знающего исход, что поднимает end-to-end успех на held-out SWE-bench Pro.
Почему это важно
111 апвотов на HF Daily (23.09); новая ось оценки качества агента за пределами итоговой точности.
Важность: 4/5
Заметная статья со 100+ апвотами HF Daily
Источники
вторичный
HuggingFace Daily Papers 2026-09-23