Xiaomi-Robotics-1: масштабирование vision-language-action моделей на более чем 100 тыс. часов реальных траекторий
Xiaomi Robotics
Xiaomi Robotics представила базовую vision-language-action модель, предобученную более чем на 100 000 часов реальных траекторий манипуляций с использованием пайплайна автоматической аннотации изменений сцены на естественном языке, с последующей адаптацией под конкретные робототехнические платформы. Модель достигает 57,6% успешных выполнений на RoboCasa365 (против прежнего рекорда в 46,6%) и результата 20,07 на RoboDojo (против прежнего рекорда 13,07), код и веса обещаны к публикации.
Почему это важно
Статья набрала 215 голосов на HuggingFace Daily Papers — наибольшее число за период, что говорит о сильном интересе сообщества к масштабированию VLA-моделей на реальных данных большого объёма.
Важность: 3/5
Лидер по голосам HF Daily Papers (215 голосов, порог >=100) -> +1 к базовой оценке 2.