MerchantBench: оценка LLM-агентов на долгосрочную согласованность в операциях электронной коммерции
Alibaba Group
365-дневная симулированная среда электронной коммерции на уровне заказов, основанная на почти 99 000 реальных записей товаров с маркетплейса 1688, с 26 инструментами взаимодействия, предназначенная для проверки способности LLM-агентов сохранять целенаправленное, адаптивное поведение на длительных операционных горизонтах.
Почему это важно
По итогам 48 прогонов на восьми LLM и двух агентных фреймворках LLM-агенты показывают существенный разрыв в производительности по сравнению с человеческим базовым уровнем, подчёркивая, насколько современные агенты далеки от надёжной долгосрочной автономной работы.
Важность: 2/5
Заметный новый бенчмарк для агентов с длинным горизонтом планирования, основанный на реальных данных маркетплейса.
Источники
официальный
HuggingFace Daily Papers, 2026-08-05