Читаемость — не интерпретируемость: оценённая против реальной важности шагов в chain-of-thought
Определяет истинную важность шага рассуждения через Monte-Carlo-роллауты — изменение ожидаемой награды при наличии этого шага — и проверяет, могут ли LLM-судьи восстановить её из CoT-текста. Способные судьи превосходят базлайн по распространённости, но сильно не дотягивают до noise-потолка; даже файнтюненные step-level-критики остаются далеко от потолка на корректных ответах.
Почему это важно
Статья COLM 2026. Предостерегающий результат для process reward modeling и диагностики ошибок LLM-судей: важность шага лишь частично восстановима из трейса рассуждения, так что читаемый CoT — не то же самое, что интерпретируемый CoT.
Важность: 3/5
Заметная статья COLM 2026 с последствиями для process reward modeling