MerchantBench: оценка LLM-агентов на долгосрочную согласованность в операциях электронной коммерции

Alibaba Group

исследования официальный 2 ист. ~1 мин

365-дневная симулированная среда электронной коммерции на уровне заказов, основанная на почти 99 000 реальных записей товаров с маркетплейса 1688, с 26 инструментами взаимодействия, предназначенная для проверки способности LLM-агентов сохранять целенаправленное, адаптивное поведение на длительных операционных горизонтах.

Почему это важно

По итогам 48 прогонов на восьми LLM и двух агентных фреймворках LLM-агенты показывают существенный разрыв в производительности по сравнению с человеческим базовым уровнем, подчёркивая, насколько современные агенты далеки от надёжной долгосрочной автономной работы.

Важность: 2/5

Заметный новый бенчмарк для агентов с длинным горизонтом планирования, основанный на реальных данных маркетплейса.

Источники

официальный HuggingFace Daily Papers, 2026-08-05