Beneath the Surface of Chains-of-Thought: механистическая интерпретация операций рассуждения в LLM
NAVER AI Lab
Показано, что функциональные операции рассуждения в CoT — формулировка задачи, декомпозиция цели, дедукция — линейно разделимы в отложенных скрытых состояниях, с пиком в средних слоях и без объяснения лексическими или позиционными конфаундерами. Интервенции маскированием внимания показывают, что выровненные с операциями представления в начале чанка зависят от предшествующего контекста рассуждения. EMNLP 2026 Main, код на github.com/naver-ai/beneath-cot.
Почему это важно
Даёт механистическое свидетельство, что текст CoT соответствует внутренней геометрической структуре, — шаг к проверке того, отражает ли записанное рассуждение реальные вычисления модели, а не постфактум-рационализацию.
Важность: 2/5
Заметная статья по механ-интерпретируемости, принятая на EMNLP 2026 Main