Don't Drop Dropout: оптимизация разреженности слоёв для эффективного обучения и инференса LLM

Cerebras

исследования официальный 2 ист. ~1 мин

Аргументирует возвращение stochastic depth в претрейн LLM: с настроенным распределением по слоям и расписаниями модели совпадают или превосходят baseline по валидационному лоссу, сокращая обучающие FLOPs до 25%, а структура пропущенных слоёв открывает early exit, layer skipping и self-speculative decoding для инференса до 1,5x быстрее. Подкреплено 2400+ запусками от 271M до 8,2B параметров на Cerebras CS-3.

Почему это важно

Layer dropout исчез из современных рецептов претрейна; опубликованные на ICML 2026 результаты такого масштаба делают его практичным рычагом и для стоимости обучения, и для постфактум-ускорения инференса на том же чекпоинте.

Важность: 2/5

Исследование индустриального масштаба (2400+ запусков) с практичным рычагом стоимости обучения

Источники