Статья ByteDance Seed исследует, как часто высококачественные доменные данные следует повторять при масштабировании LLM
ByteDance
Команда ByteDance Seed опубликовала работу Scaling Domain Data Repetition in LLM Pretraining (arXiv 2608.14071, отправка на HF paper-page 17 августа, листинг arXiv 14 августа). При фиксированном количестве токенов на параметр оптимальное число повторений слегка увеличивается с размером модели; оптимальное повторение сильно отрицательно коррелирует с валидационными потерями по доменам; значения, подобранные на меньших прокси-моделях с тем же TPP, переносятся на более крупные модели.
Почему это важно
Конкретное переносимое правило для настройки того, как часто повторять дефицитные высококачественные доменные данные по мере роста LLM — напрямую применимо для обучения доменно-специализированных моделей на небольших корпусах, поскольку рецепт масштабируется без перенастройки поиска.
Важность: 3/5
open-weights / GA marker