Visual Contrastive Self-Distillation

University of Maryland

исследования официальный 2 ист. ~1 мин

VCSD устраняет необходимость во внешних моделях-учителях или привилегированных цепочках рассуждений при самодистилляции для визуально-языковых моделей. EMA-учитель оценивает токены в двух условиях — с исходным изображением и с удалённым содержимым изображения, — и получившийся разрыв в логарифмических вероятностях используется для усиления сигнала дистилляции без дополнительных затрат на этапе инференса.

Почему это важно

Вторая по числу голосов статья на HuggingFace Daily Papers за этот день (25 голосов), сообщающая о заметном приросте показателей на Qwen3-VL/Qwen3.5 (например, с 62,27% до 67,04% на модели с 2B параметров) благодаря рецепту обучения без учителя.

Важность: 2/5

Заметный исследовательский релиз; вторая по рейтингу статья HF Daily Papers, ниже порога в 100 голосов для повышения значимости.

Источники

официальный Visual Contrastive Self-Distillation