#interpretability
- Глобальное рабочее пространство в языковых моделях Anthropic research
- Насколько прозрачна DiffusionGemma? Исследование интерпретируемости сокращает разрыв с авторегрессионными моделями Google DeepMind research
- Маска — не модель: аудит prefix-инвариантности в attention, state-space и гибридных sequence-моделях research
- Natural Language Autoencoders: превращение внутренних состояний Claude в текст Anthropic research
- Anthropic представляет Natural Language Autoencoders для масштабируемой интерпретируемости LLM Anthropic research
- Judge Circuits: механистическое объяснение непоследовательности LLM-as-judge по форматам research
- CiteVQA: бенчмарк атрибуции доказательств для надёжной document intelligence (178 апвоутов на HF) Peking University / Shanghai Artificial Intelligence Laboratory research
- Вмешательства SAE ненадёжны: подавленное поведение восстанавливается после интервенции Hong Kong Polytechnic University research
- BadWAM: когда модели «мир-действие» правильно мечтают, но неправильно действуют research
- Читаемость — не интерпретируемость: оценённая против реальной важности шагов в chain-of-thought research
- «Супервеса» в LLM и провал избирательного обучения Amazon Web Services research
- Сбер и Сколтех представили TOHA — дешёвый метод на топологии внимания для детекции RAG-галлюцинаций (ACL 2026) Sber/Skoltech (LARSS joint lab) research
- Quantifying Faithful Confidence Expression in Large Reasoning Models Yale NLP research
- Анатомия пост-обучения: использование интерпретируемости для аудита и исправления данных предпочтений research
- Формализация латентных мыслей: аксиоматический фреймворк для оценки репрезентаций рассуждений LLM University of British Columbia research
- GradCuit: градиентный поток с распределением ответственности обеспечивает устойчивое и интерпретируемое рассуждение в латентном пространстве во время инференса research
- Anthropic ослабила классификаторы биобезопасности Claude Fable 5, сократив ложные блокировки на 85% Anthropic research
- Кража трасс рассуждений из проприетарных LLM API research
- Beneath the Surface of Chains-of-Thought: механистическая интерпретация операций рассуждения в LLM NAVER AI Lab research
- LLM Safety From Within (SIREN) University of Toronto CSSLab / McGill / LMU Munich research