#robotics
- NVIDIA выпускает Cosmos 3: открытая омнимодальная фундаментальная модель для физического AI NVIDIA research
- Kairos: полноценный стек мировых моделей для физического AI ACE Robotics research
- Black Forest Labs выпускает FLUX 3 — мультимодальную модель, генерирующую видео с синхронизированным звуком Black Forest Labs video
- HiFi-UMI: обучение развёртываемых политик манипуляции только на данных высокоточного UMI Simple AI (Simple World Lab) research
- Google DeepMind представила Gemini Robotics 2 для управления всем телом гуманоидов Google DeepMind research
- TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM research
- AI2 публикует в открытый доступ MolmoAct2: роботизированная VLA, превосходящая GPT-5 в воплощённом рассуждении AI2 research
- Humanoid-GPT: Scaling to 2B Motion Frames Enables Zero-Shot Generalization in Humanoid Control research
- Alibaba выпускает Qwen-RobotSuite: три базовых модели для воплощённого ИИ Alibaba / Qwen models-llm
- Alibaba запускает Qwen-Robot Suite: три базовые модели для воплощённого ИИ и робототехники Alibaba / Qwen models-llm
- ENPIRE: агенты кодирования ИИ замыкают цикл физических робототехнических исследований без участия человека NVIDIA / Carnegie Mellon University / UC Berkeley research
- World Action Models: обзор National University of Singapore research
- Беспилотный грузовик Яндекса совершил первый полностью автономный рейс Москва–Санкт-Петербург протяжённостью 700 км Yandex industry
- GigaWorld-1: дорожная карта для построения моделей мира для оценки роботизированных политик GigaAI research
- LingBot-VLA 2.0: преодоление разрыва между базовыми VLA-моделями и реальным развёртыванием LingBot Team research
- Mistral выпускает Robostral Navigate: модель навигации роботов с одной камерой Mistral research
- InternVLA-A1.5: объединение понимания, латентного предвидения и действия для композиционной генерализации InternRobotics research
- RLDX-1: Multi-Stream Action Transformer достигает 86,8% на гуманоидных задачах ALLEX RLWRLD research
- PhysBrain 1.0: эгоцентрическое видео людей как обучающие данные для VLA-моделей роботов (133 апвоута на HF) DeepCybo research
- ABot-AgentOS: операционная система для роботизированных агентов с долгосрочной мультимодальной памятью Alibaba research
- ABot-N1: базовая модель визуально-языковой навигации с архитектурой slow-fast Alibaba research
- BadWAM: когда модели «мир-действие» правильно мечтают, но неправильно действуют research
- Xiaomi-Robotics-1: масштабирование vision-language-action моделей на 100 000+ часов реальных траекторий Xiaomi Robotics research
- Xiaomi-Robotics-1: масштабирование vision-language-action моделей на более чем 100 тыс. часов реальных траекторий Xiaomi Robotics research
- RynnBrain 1.1: на пути к более способной и обобщающей embodied-модели Alibaba DAMO Academy research
- Project Pilot от Anthropic проверяет, способны ли AI-модели управлять дронами Anthropic research
- N0-TWAM: масштабирование тактильно-нативной world-action модели для манипуляций с контактом NeoteAI / Fudan TEAI research
- World Action Models: первый систематический обзор воплощённых фундаментальных моделей, объединяющих моделирование мира и действия OpenMOSS research
- Галлюцинации в моделях мира предсказуемы и предотвратимы UC San Diego research
- Tencent выпустил обновление HY-Embodied-0.5-X для воплощённых агентов Tencent models-llm
- Игровое агентное обучение роботов: самостоятельная игра формирует переносимые навыки UC Berkeley research
- PhysisForcing: мировые модели с физическими ограничениями повышают успешность манипуляций роботов на 50% Peking University / NVIDIA research