AISPA: пользователецентричный аудит системных промптов для приложений на больших языковых моделях

Stanford University

исследования официальный 2 ист. ~1 мин

Представлена система аудита по 8 измерениям (прозрачность идентичности, приватность, предотвращение манипуляций, предотвращение вреда, справедливость и др.), основанная на руководствах по AI-безопасности и статьях о правах человека, с помощью которой проведён аудит 3249 инструкций системных промптов в 88 коммерческих AI-продуктах.

Почему это важно

Эмпирический вывод: 98,9% проверенных продуктов содержат хотя бы одну защитную инструкцию, но только 24% охватывают все восемь измерений безопасности, а примерно 40% содержат хотя бы одну инструкцию, действующую против интересов пользователя.

Важность: 2/5

Заметный эмпирический аудит безопасности, только официальный источник arxiv/HF; 28 апвоутов на HF Daily Papers, ниже порога буста в 100 апвоутов.

Источники