Beneath the Surface of Chains-of-Thought: механистическая интерпретация операций рассуждения в LLM

NAVER AI Lab

исследования официальный 1 ист. ~1 мин

Показано, что функциональные операции рассуждения в CoT — формулировка задачи, декомпозиция цели, дедукция — линейно разделимы в отложенных скрытых состояниях, с пиком в средних слоях и без объяснения лексическими или позиционными конфаундерами. Интервенции маскированием внимания показывают, что выровненные с операциями представления в начале чанка зависят от предшествующего контекста рассуждения. EMNLP 2026 Main, код на github.com/naver-ai/beneath-cot.

Почему это важно

Даёт механистическое свидетельство, что текст CoT соответствует внутренней геометрической структуре, — шаг к проверке того, отражает ли записанное рассуждение реальные вычисления модели, а не постфактум-рационализацию.

Важность: 2/5

Заметная статья по механ-интерпретируемости, принятая на EMNLP 2026 Main

Источники