LLM теряются при изменении намерений пользователя

Microsoft Research

исследования официальный 2 ист. ~1 мин

В статье представлен фреймворк, преобразующий стандартные однооборотные задачи в многооборотные диалоги, где цель пользователя меняется в процессе общения, и проверяется, насколько хорошо LLM отслеживают эти изменения. Выяснилось, что высокая производительность в однооборотном режиме не переносится на этот сценарий с изменяющимися намерениями — точность существенно падает во всех семействах моделей.

Почему это важно

Статья выявляет слепое пятно в текущей методологии оценки моделей — модели, выглядящие компетентными на статичных бенчмарках, могут серьёзно проваливаться при отслеживании меняющихся целей, а это ключевая способность для реальных совместных агентов.

Важность: 2/5

Значимая статья по методологии оценки; ниже порога в 100 апвоутов для HF Daily bump.

Источники

официальный LLMs Get Lost in Evolving User Intent