NCP-ArchPreview: латентные языковые модели на 8,9B параметров через Next Concept Prediction
Shanghai AI Lab
Команда Intern-NCP масштабировала латентную языковую модель до 8,9B параметров, обученных на 5,73T токенов — крупнейшая такая демонстрация на сегодня. Поверх next-token prediction добавлен Next Concept Prediction: product-quantized словарь концептов, построенный из hidden states, Concept Module, предсказывающий будущие многотокенные концепты, и обратная связь этих предсказаний для управления токен-уровневой генерацией — всё обучается end-to-end. Модель достигает финального лосса предобучения OLMo-3-7B на 51,3% токенов и после полного предобучения обгоняет её на 2,45 пункта по macro-average (+5,99 на GSM8K); один лишь VQ-модуль на 17M параметров обеспечивает дешёвую доменную адаптацию и улучшает принятую длину в speculative drafting на 4,17%.
Почему это важно
177 апвотов на HuggingFace Daily Papers (11 сентября); контролируемый тест на массовом масштабе, подтверждающий, что концепт-уровневые латенты дают sample efficiency, с конкретными побочными выгодами в адаптации и speculative decoding.
Важность: 4/5
Заметная статья со 177 апвотами на HF Daily (буст за >=100 апвотов)