Кража трасс рассуждений из проприетарных LLM API
Исследователи показывают, что зашифрованные блоки трасс рассуждений, возвращаемые крупными LLM API, взаимозаменяемы между сессиями, пользователями и даже разными моделями, что позволяет злоумышленникам внедрять их в более слабые модели, вынуждая раскрывать открытым текстом дословные рассуждения.
Почему это важно
Документированы четыре вектора атаки, затрагивающие Anthropic, OpenAI и Google, с извлечением 367 артефактов PII и 182 учётных данных из более чем 315 000 собранных блоков рассуждений; предложены криптографические и системные меры защиты.
Важность: 2/5
Исследование по безопасности ниже порога в 100 голосов для бампа; оставлено на дефолтном уровне notable-update.