Читаемость — не интерпретируемость: оценённая против реальной важности шагов в chain-of-thought

исследования официальный 1 ист. ~1 мин

Определяет истинную важность шага рассуждения через Monte-Carlo-роллауты — изменение ожидаемой награды при наличии этого шага — и проверяет, могут ли LLM-судьи восстановить её из CoT-текста. Способные судьи превосходят базлайн по распространённости, но сильно не дотягивают до noise-потолка; даже файнтюненные step-level-критики остаются далеко от потолка на корректных ответах.

Почему это важно

Статья COLM 2026. Предостерегающий результат для process reward modeling и диагностики ошибок LLM-судей: важность шага лишь частично восстановима из трейса рассуждения, так что читаемый CoT — не то же самое, что интерпретируемый CoT.

Важность: 3/5

Заметная статья COLM 2026 с последствиями для process reward modeling

Источники