Visual Contrastive Self-Distillation
University of Maryland
VCSD устраняет необходимость во внешних моделях-учителях или привилегированных цепочках рассуждений при самодистилляции для визуально-языковых моделей. EMA-учитель оценивает токены в двух условиях — с исходным изображением и с удалённым содержимым изображения, — и получившийся разрыв в логарифмических вероятностях используется для усиления сигнала дистилляции без дополнительных затрат на этапе инференса.
Почему это важно
Вторая по числу голосов статья на HuggingFace Daily Papers за этот день (25 голосов), сообщающая о заметном приросте показателей на Qwen3-VL/Qwen3.5 (например, с 62,27% до 67,04% на модели с 2B параметров) благодаря рецепту обучения без учителя.
Важность: 2/5
Заметный исследовательский релиз; вторая по рейтингу статья HF Daily Papers, ниже порога в 100 голосов для повышения значимости.