HumanCLAW: способны ли vision-language модели действовать через тело?

Meta Research

исследования офиц. + СМИ 2 ист. ~1 мин

Meta представляет HumanCLAW-Bench — 1218 длинных эгоцентрических эпизодов «найти-добраться-взаимодействовать» на 41 помещении, а также фреймворк, отделяющий принятие решений от моторного исполнения, чтобы изолировать «интеллект действия» VLM. Лучшая из девяти протестированных передовых моделей достигла успеха лишь в 16,8% случаев, при этом сбои объясняются потерей осознания собственного тела, а не плохим распознаванием целей.

Почему это важно

Представлена в HuggingFace Daily Papers (30 июля 2026, 43 голоса); резкий результат бенчмарка показывает, что современные VLM с трудом отслеживают состояние собственного тела при выполнении воплощённых задач, что актуально для более широкого движения к agentic-подходам и робототехнике в разных лабораториях.

Важность: 3/5

Резкий результат бенчмарка от близкой к передовой лаборатории (Meta) по самоосознанию воплощённых VLM, заметная находка.

Источники