Защитные механизмы на основе копируемого контекста не могут обеспечить надёжную безопасность LLM
Формализуется «трилемма безопасности»: для задач двойного назначения защитные механизмы LLM не могут одновременно обеспечивать полезные возможности, надёжную безопасность и открытый доступ, поскольку злоумышленник может скопировать или имитировать любые доказательства промпта/контекста, которые предъявил бы легитимный пользователь. Выводится математическая нижняя граница помощи злоумышленнику в худшем случае и предлагаются «доверенные учётные данные» — трудно копируемые, привязанные к использованию доказательства — как необходимое дополнение к защите на основе промптов.
Почему это важно
Теоретический результат с прямыми последствиями для того, как лаборатории проектируют политики отказа и контроля доступа для возможностей двойного назначения, утверждающий, что сегодняшние защитные механизмы на основе копируемого контекста структурно недостаточны.
Важность: 2/5
Заметная теоретическая статья по безопасности, единственный официальный источник arxiv.