Don't Drop Dropout: оптимизация разреженности слоёв для эффективного обучения и инференса LLM
Cerebras
Аргументирует возвращение stochastic depth в претрейн LLM: с настроенным распределением по слоям и расписаниями модели совпадают или превосходят baseline по валидационному лоссу, сокращая обучающие FLOPs до 25%, а структура пропущенных слоёв открывает early exit, layer skipping и self-speculative decoding для инференса до 1,5x быстрее. Подкреплено 2400+ запусками от 271M до 8,2B параметров на Cerebras CS-3.
Почему это важно
Layer dropout исчез из современных рецептов претрейна; опубликованные на ICML 2026 результаты такого масштаба делают его практичным рычагом и для стоимости обучения, и для постфактум-ускорения инференса на том же чекпоинте.
Важность: 2/5
Исследование индустриального масштаба (2400+ запусков) с практичным рычагом стоимости обучения
Источники
официальный
Don't Drop Dropout — Hugging Face Daily Papers