TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM
Переформулирует моделирование «зрение-язык-действие» как прямое отображение V+L в действия вместо маршрутизации через крупную языковую модель, достигая среднего успеха 97.7% на LIBERO всего с 0.2 млрд параметров, задержкой 31.2 мс и менее 1 ГБ VRAM на потребительской RTX 4090.
Почему это важно
Набрала 122 голоса в HuggingFace Daily Papers за 2026-07-30; сравнима или превосходит гораздо более крупные VLA-системы на базе LLM, делая управление роботом в реальном времени осуществимым на потребительском железе.
Важность: 4/5
Заметная исследовательская статья с ≥100 голосами в HF Daily Papers (122), запускающая эвристическое повышение уверенности.
Источники
официальный
TurboVLA