【BDS国家工程中心】2023大语言模型提示注入攻击安全风险分析报告_55页_3mb
报告摘要
大语言模型提示注入攻击安全风险分析报告
大数据协同安全技术国家工程研究中心,2023年7月
随着基于Transformer架构的大语言模型(LLM)参数量突破千亿级,其在文本生成领域展现出强大能力,但安全风险随之凸显。提示注入攻击作为新兴威胁,通过恶意指令覆盖模型原始任务,导致生成有害内容、泄露隐私或执行任意代码,已成为大模型安全的首要风险。本报告系统分析提示注入攻击类型及防御策略,构建测评数据集并开展实验评估。
提示注入攻击分类
攻击可分为直接注入和间接注入两类。直接注入包括:
- 目标劫持:攻击者插入指令使模型偏离原始任务(如翻译任务被替换为诗歌创作)。
- 提示泄露:窃取模型原始提示信息(如系统规则、用户隐私等),分为系统提示泄露(如微软BingChat的规则暴露)和用户提示泄露(如数据泄露事件)。
- 越狱攻击:绕过模型限制生成违规内容,分为模拟对话(诱导模型聚焦对话形式)、角色扮演(脱离行为约束)和对立响应(隐藏恶意内容于正常回复之后)。
间接注入通过文档、代码注释等载体隐藏恶意指令,例如利用Base64编码绕过输出过滤,或通过代码补全工具(如GitHub Copilot)执行植入注释中的恶意代码。
防御技术研究
防御分为输入侧与输出侧策略:
-
输入侧防御:
- 提示过滤:基于规则(黑白名单)或模型(如BERT、ChatGPT)识别恶意输入。规则过滤存在覆盖不全问题,而模型分类可更灵活适应复杂场景。
- 提示增强:
- 语义增强:通过鲁棒任务描述(明确对抗恶意指令)和少样本学习(注入示例提升模型抗攻击能力)强化提示。
- 结构增强:调整提示位置(如将用户输入前置)、使用特殊符号(如XML标签)增强指令与内容区分性。
- 组合增强:集成语义与结构策略,提升防御效果。
-
输出侧防御:
- 内容审核过滤:基于规则的敏感词检测与基于模型的合规性判断(如检测输出是否符合任务要求)。
- 匹配性验证:通过第三方模型识别输出与任务的一致性,防止信息泄露或偏移。
测评数据集构建
报告构建了覆盖3类攻击方法(越狱、目标劫持、提示泄露)和6类安全场景(身心健康、隐私财产等)的测评数据集,包含36000条数据。通过人工设置种子问题、模板生成、模型仿写等方法生成恶意数据,并利用审核模型验证其有效性。
实验评估结果
-
攻击成功率:
- GPT-3.5-turbo、PaLM2、Vicuna-13B的平均攻击成功率为79.54%、75.41%、67.24%。
- 越狱攻击成功率最高(平均81.04%),模拟对话攻击效果尤为突出(平均86.89%)。
-
防御效果:
- 单一防御策略中,更改提示位置效果最佳;组合增强策略(如鲁棒描述+位置调整)进一步提升防御能力。
- 基于模型检测的防御方法对攻击识别准确率超90%,但存在2%-10%的漏检率。
总结与建议
当前大语言模型普遍面临提示注入攻击风险,需构建多层次防御体系:
- 安全测评:开展网络安全(渗透测试)与内容安全(恶意输入检测)双重评估。
- 防御优化:强化训练数据过滤,结合提示增强与模型检测提升鲁棒性。
- 监测预警:建立威胁情报库和自动化预警系统,实时识别异常行为。
本报告为模型厂商及开发者提供测评框架与防御策略参考,推动构建更安全可信的大语言模型应用环境。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载