2025年LLM间接提示注入漏洞解析与防御路线报告_23页_4mb
报告摘要
LLM间接提示注入漏洞解析与防御总结
本报告分析了大语言模型(LLM)的安全风险,特别是间接提示注入(Indirect Prompt Injection, IPI)攻击。IPI是一种隐藏恶意指令在外部内容中的方式,通过模型解析上下文或引用内容时自动执行,攻击成功率较高,尤其在某些类别中可达36.8%(如禁止行为)。这源于模型难以区分指令与数据,形式化研究显示所有LLM均未完全分离两者,缓解技术如提示工程和微调能改善但未彻底解决问题。
真实案例涉及文档和对话插件,攻击者利用相似指令输入,如“翻译该文档”,注入恶意内容,窃取用户数据或历史记录。测试显示,ChatGPT等模型易受指令劫持,测试范围包括翻译、隐私泄露等功能。
防御对策包括:输入过滤(剔除潜在恶意片段)、指令结构强化(明确区分指令与数据)、模型自身调优(通过RLHF增强安全能力),以及实时检测机制,如内容安全、敏感信息和网址安全检测,以减少攻击风险。
总之,IPI是LLM安全首要威胁,需多层防御来提升模型鲁棒性和保护用户数据。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载