Xiaomi-Robotics-1: масштабирование vision-language-action моделей на 100 000+ часов реальных траекторий

Xiaomi Robotics

исследования официальный 2 ист. ~1 мин

Xiaomi Robotics представляет vision-language-action фундаментальную модель, обученную более чем на 100 000 часах данных о реальных манипуляциях, собранных с помощью устройств UMI, с использованием двухэтапного пайплайна предобучения/пост-обучения с автоматически сгенерированными языковыми аннотациями. Модель устанавливает state-of-the-art результаты на бенчмарках RoboCasa365 (57,6% успеха) и RoboDojo.

Почему это важно

В тренде Hugging Face Daily Papers с 72 голосами — одна из наиболее обсуждаемых работ по робототехнике за неделю и показательный ориентир того, сколько данных о реальных траекториях требуется для масштабирования VLA-моделей.

Важность: 3/5

Заметный исследовательский релиз с SOTA-результатами на робототехнических бенчмарках и высоким вниманием сообщества (72 голоса HF Daily, ниже порога буста в 100 голосов).

Источники

официальный Xiaomi-Robotics-1 on HF Daily Papers
официальный Xiaomi-Robotics-1 arXiv preprint