大语言模型提示注入攻击安全风险分析报告-大数据协同安全技术国家工程研究中心-2023.7.6-55页_1mb
报告摘要
报告分析总结
大语言模型提示注入攻击安全风险分析报告概述了LMMs的安全威胁、防御策略和实验评估。
-
核心风险:提示注入攻击通过恶意输入操纵LMM输出,类型包括目标劫持、提示泄露和越狱攻击,影响OpenAI、Google等LMMs,攻击成功率高达67%–80%。风险源于LMMs对指令处理的模糊性和缺乏严格验证。
-
防御方法:分为输入侧(提示过滤、增强)和输出侧(内容审核)。输入侧:基于规则和模型的过滤、提示增强如任务描述改进和结构调整。输出侧:检测敏感输出,使用第三方模型进行合规性匹配。实验显示,防御策略可降低攻击成功率,但无万能方案。
-
测评发现:使用自建数据集攻击GPT-3.5-turbo、PaLM2和Vicuna-13B,展示了在健康、隐私等场景的高风险。基于模型检测的准确性良好,但存在误检和漏检。
-
结论与建议:LMMs需通过网络安全评估、数据强化训练和协同防御体系建设来增强安全性,并建立安全监测平台以防范威胁。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载