Автоматизированные исследователи способны надёжно устранять сбои выравнивания

Anthropic

исследования офиц. + СМИ 2 ист. ~1 мин

Anthropic опубликовала работу, в которой показано, что агент Automated Alignment Researcher (AAR) выполняет поиск по литературе, предлагает методы и обучает модели, закрывая разрывы в выравнивании. В десяти категориях сбоев — включая обман, соглашательство и нарушения приватности — система закрыла от 26% до 96% разрыва в безопасности и превзошла 28 исследователей-людей в области безопасности на задачах вроде снижения обмана; один прогон поднял ранний чекпоинт Claude Opus 4.8 почти до продакшен-уровня выравнивания за 60 часов.

Почему это важно

Первые свидетельства в духе peer-review, что ИИ-агент способен выполнять содержательные исследования по выравниванию end-to-end быстрее и дешевле команд людей; делает рекурсивное самоулучшение в выравнивании правдоподобным в ближайшей перспективе, а не спекулятивным.

Важность: 2/5

официальное подтверждение

Источники