Защитные механизмы на основе копируемого контекста не могут обеспечить надёжную безопасность LLM

исследования официальный 1 ист. ~1 мин

Формализуется «трилемма безопасности»: для задач двойного назначения защитные механизмы LLM не могут одновременно обеспечивать полезные возможности, надёжную безопасность и открытый доступ, поскольку злоумышленник может скопировать или имитировать любые доказательства промпта/контекста, которые предъявил бы легитимный пользователь. Выводится математическая нижняя граница помощи злоумышленнику в худшем случае и предлагаются «доверенные учётные данные» — трудно копируемые, привязанные к использованию доказательства — как необходимое дополнение к защите на основе промптов.

Почему это важно

Теоретический результат с прямыми последствиями для того, как лаборатории проектируют политики отказа и контроля доступа для возможностей двойного назначения, утверждающий, что сегодняшние защитные механизмы на основе копируемого контекста структурно недостаточны.

Важность: 2/5

Заметная теоретическая статья по безопасности, единственный официальный источник arxiv.

Источники