#vlm
- S²VOPD: самообучаемая визуальная on-policy дистилляция поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия UC San Diego research
- Spatial Memory Agent: процедурная память на основе опыта для пространственного интеллекта Zhejiang University research
- OpenSearch-VL: открытый рецепт обучения мультимодальных агентов поиска Tencent Hunyuan research
- TimeLens2: универсальное временное позиционирование в видео с мультимодальными LLM MCG-NJU (Nanjing University) research
- Astra: VLM с RL-обучением запрашивает симулятор мира для пространственных рассуждений research
- VRRL: визуально заземлённая саморефлексия для моделей зрение-язык через RL UT Austin / Cornell research
- Умные камеры Яндекса получили визуальные Q&A через VLM Алисы Yandex tools
- Visual Contrastive Self-Distillation University of Maryland research
- GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео? ByteDance Seed research
- Co-RL: unsupervised reasoning возникает из разнообразной когорты в multi-agent RL UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.) research
- ВКонтакте внедряет LLM и VLM для товарных рекомендаций в ленте VK AI tools