TurboVLA: модель «зрение-язык-действие» в реальном времени на 32 Гц на RTX 4090 с менее чем 1 ГБ VRAM

исследования офиц. + СМИ 2 ист. ~1 мин

Переформулирует моделирование «зрение-язык-действие» как прямое отображение V+L в действия вместо маршрутизации через крупную языковую модель, достигая среднего успеха 97.7% на LIBERO всего с 0.2 млрд параметров, задержкой 31.2 мс и менее 1 ГБ VRAM на потребительской RTX 4090.

Почему это важно

Набрала 122 голоса в HuggingFace Daily Papers за 2026-07-30; сравнима или превосходит гораздо более крупные VLA-системы на базе LLM, делая управление роботом в реальном времени осуществимым на потребительском железе.

Важность: 4/5

Заметная исследовательская статья с ≥100 голосами в HF Daily Papers (122), запускающая эвристическое повышение уверенности.

Источники

официальный TurboVLA