2023大语言模型提示注入攻击安全风险分析报告-BDS国家工程中心_55页_3mb
报告摘要
大语言模型提示注入攻击安全风险分析报告
大数据协同安全技术国家工程研究中心 2023年7月6日
报告核心内容总结:
-
背景与风险现状
大语言模型(LLM)因参数量突破千亿及强大生成能力被广泛应用,但也面临提示注入攻击等安全风险。OpenAI、Google、Meta等企业及国内文心一言、通义千问等模型均曾发生隐私泄露、敏感信息输出、代码执行漏洞等事件。提示注入攻击通过恶意指令覆盖原始任务,可导致生成有害内容、泄露隐私或绕过系统限制,已被OWASP列为LLM十大安全威胁之首。 -
提示注入攻击分类
- 直接注入攻击:包含目标劫持(改变任务类型)、提示泄露(窃取原始提示内容)、越狱攻击(绕过审核机制)。例如,攻击者通过“Ignore above instructions”等指令劫持模型任务,或利用Base64编码绕过输出过滤。
- 间接注入攻击:通过文档、网页等载体隐藏恶意指令,利用模型对用户输入的依赖性触发攻击。如BingChat通过读取用户页面内容,攻击者将恶意指令嵌入PDF文档,模型可能因输入侧过滤失效而输出恶意内容。
-
防御技术框架
防御分为输入侧和输出侧两类:- 输入侧防御:
- 提示过滤:基于规则(黑白名单)或模型分类(如BERT、ChatGPT)检测恶意输入。规则过滤效果稳定但覆盖有限,模型分类可应对复杂攻击,但存在误检和漏检问题。
- 提示增强:通过语义增强(如鲁棒任务描述、少样本学习示例)和结构增强(调整提示位置、特殊符号标记)提升模型抗攻击能力。组合增强策略在防御效果上优于单一方法。
- 输出侧防御:利用内容审核过滤机制(如合规性判断、匹配性验证)识别非法输出,但目前依赖外部过滤工具,模型自身对恶意问题的抵抗力较弱。
- 输入侧防御:
-
测评数据集构建
报告构建了包含36000条数据的测评体系,覆盖越狱攻击、目标劫持、提示泄露三大类攻击场景:- 越狱攻击数据集:包含6类安全场景(身心健康、隐私财产等)及简单/复杂指令,用于评估模型对不同攻击类型的敏感性。
- 目标劫持数据集:结合原始任务与劫持指令,测试模型是否被恶意指令干扰。
- 提示泄露数据集:通过原始提示与泄露指令的组合,衡量模型是否泄露敏感信息。
-
实验评估结果
- 攻击成功率:GPT-3.5-turbo平均攻击成功率为79.54%,PaLM2为75.41%,Vicuna-13B为67.24%。越狱攻击(尤其模拟对话和角色扮演)在所有模型中成功率最高(平均86.89%)。
- 防御效果:提示增强(如更改提示位置、特殊符号标记)显著降低攻击成功率,其中更改提示位置效果最佳;模型检测方法在输入和输出层面均能有效识别攻击,但存在10%的漏检率和2.21%的平均误检率。
-
总结与建议
- 安全测评:需建立覆盖网络安全和内容安全的测评体系,通过渗透测试、威胁情报库等手段发现漏洞。
- 防御体系:建议结合输入过滤、提示增强、模型检测等多层次防御,强化训练数据的鲁棒性,提升输入输出的合规性校验。
- 监测预警:构建安全风险监测平台,实时分析攻击模式,自动预警潜在威胁。
报告意义:为LLM厂商及开发者提供防御框架和测评方法,推动构建更安全的大语言模型生态。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载