#vlm
- S²VOPD: самообучаемая визуальная on-policy дистилляция поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия UC San Diego research
- Spatial Memory Agent: процедурная память на основе опыта для пространственного интеллекта Zhejiang University research
- Qwen выпускает Qwen-Drive-1.0 — открытую vision-language модель для автономного вождения Qwen/Alibaba models-llm
- DeepSeek открыла веса V4-Flash-Vision-Exp — первой мультимодальной модели линейки V4 — под MIT DeepSeek models-llm
- OpenSearch-VL: открытый рецепт обучения мультимодальных агентов поиска Tencent Hunyuan research
- TimeLens2: универсальное временное позиционирование в видео с мультимодальными LLM MCG-NJU (Nanjing University) research
- Яндекс объединил VLM и LLM в единую омни-модель, на которой работает Alice AI Yandex models-llm
- Astra: VLM с RL-обучением запрашивает симулятор мира для пространственных рассуждений research
- Wuhan AI Lab открывает ZDTaichu5.0-9B — VLM для пространственного рассуждения менее 10B параметров Wuhan Artificial Intelligence Research Institute (Taichu) models-llm
- VRRL: визуально заземлённая саморефлексия для моделей зрение-язык через RL UT Austin / Cornell research
- Умные камеры Яндекса получили визуальные Q&A через VLM Алисы Yandex tools
- Visual Contrastive Self-Distillation University of Maryland research
- GST-Bench: способны ли VLM развивать глобальное пространственное восприятие по видео? ByteDance Seed research
- Co-RL: unsupervised reasoning возникает из разнообразной когорты в multi-agent RL UC San Diego (Yunhao Yang, Nuno Vasconcelos, Yijiang Li et al.) research
- ВКонтакте внедряет LLM и VLM для товарных рекомендаций в ленте VK AI tools