S²VOPD: самообучаемая визуальная on-policy дистилляция поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия
UC San Diego
Создаёт асимметрию учитель-ученик путём вычитания информации из ученика через визуальные аугментации, а не добавления привилегированной информации учителю. Дистилляция распределения учителя on-policy в распределение ученика на сильно аугментированном виде поднимает Qwen3.5-4B с 70,7% до 77,4% на шести бенчмарках тонкого восприятия, восстанавливая 96% прироста методов с привилегированной информацией без ground-truth, наград или более сильного учителя.
Почему это важно
159 upvotes на HuggingFace Daily Papers. Чисто самообучаемый рецепт, восстанавливающий почти весь прирост дистилляции с привилегированной информацией для VLM — полезно всем, кто файнтюнит открытые VLM без reward-моделей.
Важность: 4/5
HF Daily 159 upvotes
Источники
официальный
S²VOPD (HF Daily Papers)
СМИ
arXiv listing