#embodied-ai
- NVIDIA выпускает Cosmos 3: открытая омнимодальная фундаментальная модель для физического AI NVIDIA research
- Kairos: полноценный стек мировых моделей для физического AI ACE Robotics research
- Orca: общая фундаментальная модель мира от BAAI, обученная на 125K часов видео BAAI research
- AI2 публикует в открытый доступ MolmoAct2: роботизированная VLA, превосходящая GPT-5 в воплощённом рассуждении AI2 research
- Humanoid-GPT: Scaling to 2B Motion Frames Enables Zero-Shot Generalization in Humanoid Control research
- Alibaba выпускает Qwen-RobotSuite: три базовых модели для воплощённого ИИ Alibaba / Qwen models-llm
- Alibaba запускает Qwen-Robot Suite: три базовые модели для воплощённого ИИ и робототехники Alibaba / Qwen models-llm
- ENPIRE: агенты кодирования ИИ замыкают цикл физических робототехнических исследований без участия человека NVIDIA / Carnegie Mellon University / UC Berkeley research
- World Action Models: обзор National University of Singapore research
- GigaWorld-1: дорожная карта для построения моделей мира для оценки роботизированных политик GigaAI research
- LingBot-VLA 2.0: преодоление разрыва между базовыми VLA-моделями и реальным развёртыванием LingBot Team research
- Mistral выпускает Robostral Navigate: модель навигации роботов с одной камерой Mistral research
- HumanCLAW: способны ли vision-language модели действовать через тело? Meta Research research
- InternVLA-A1.5: объединение понимания, латентного предвидения и действия для композиционной генерализации InternRobotics research
- RLDX-1: Multi-Stream Action Transformer достигает 86,8% на гуманоидных задачах ALLEX RLWRLD research
- PhysBrain 1.0: эгоцентрическое видео людей как обучающие данные для VLA-моделей роботов (133 апвоута на HF) DeepCybo research
- DreamX-World 1.0: интерактивная модель мира общего назначения с управлением камерой 6DoF AMAP-ML (Alibaba Maps AI Lab) research
- ABot-AgentOS: операционная система для роботизированных агентов с долгосрочной мультимодальной памятью Alibaba research
- ABot-N1: базовая модель визуально-языковой навигации с архитектурой slow-fast Alibaba research
- Xiaomi-Robotics-1: масштабирование vision-language-action моделей на более чем 100 тыс. часов реальных траекторий Xiaomi Robotics research
- RynnBrain 1.1: на пути к более способной и обобщающей embodied-модели Alibaba DAMO Academy research
- Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами Anthropic research
- N0-TWAM: масштабирование тактильно-нативной world-action модели для манипуляций с контактом NeoteAI / Fudan TEAI research
- World Action Models: первый систематический обзор воплощённых фундаментальных моделей, объединяющих моделирование мира и действия OpenMOSS research
- Галлюцинации в моделях мира предсказуемы и предотвратимы UC San Diego research
- ABot-Earth 0.5: генерация 3D городских сцен из спутниковых снимков Alibaba AMAP CV Lab research