LLM间接提示注入漏洞解析与防御路线
报告摘要
LLM 间接提示注入攻击解析与防御
背景
随着大模型应用的普及,安全风险日益突出。OWASP 2025 指定“提示注入”为LLM十大安全风险首位。
间接提示注入攻击原理
- 类型定义:由Greshake等人于2023年首次提出(论文《Not what you’ve signed up for》)
- 攻击特征:隐藏潜在的提示指令于外部内容中,模型在解析上下文或处理引用内容时自动执行(如系统提示被覆盖)
攻击链案例分析
真实案例展示了如何利用文档对话场景窃取对话记录、实施钓鱼等恶意活动
- 攻击策略:通过伪造规则、篡改模型输入构造恶意指令
- 典型场景:企业文档插件、聊天机器人等辅助工具出现安全漏洞
防御对策
建议采用多层次防御机制:
- 输入过滤:在模型处理前增加恶意指令检测,过滤敏感内容
- 指令结构强化:区分合法用户指令与潜在恶意指令
- 模型自身调优:通过微调提升模型安全性和恶意内容识别能力
总结
间接提示注入是大模型面临的严峻威胁,其防御需要技术改进、安全检测和制度保障,共同构建大模型应用的安全防线。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载