2024生成式大模型安全评估白皮书-中国科学院_蚂蚁安全实验室-2024_118页_1mb
报告摘要
生成式大模型安全评估总结
一、发展现状
- 代表性模型:包括OpenAI的GPT系列、Meta的LLaMA系列、国产模型如通义千问、文心一言等。
- 应用领域:自然语言处理、图像生成、多模态任务、智能客服、金融、医疗、教育等多个领域。
- 技术特点:参数规模庞大、多项任务表现优异,但也面临生成内容准确性、安全性和隐私泄露等问题。
二、安全风险
-
伦理风险
- 加剧性别、种族偏见与歧视。
- 传播意识形态,危害国家安全。
- 学术与教育伦理风险,如作弊、内容剽窃。
- 影响社会就业与人类价值,加剧信息茧房效应。
-
内容安全风险
- 可信与恶意使用风险:制造恶意软件、传播虚假信息、违反法律法规。
- 隐私风险:侵犯用户隐私、泄露企业机密。
- 知识产权风险:训练阶段和应用阶段存在侵权问题。
-
技术安全风险
- 对抗样本攻击、后门攻击、Prompt注入攻击、数据投毒攻击、越狱攻击等。
三、安全性评估方法
-
评估维度
- 伦理性:偏见与毒性。
- 事实性:生成内容的准确性。
- 隐私性:数据泄露风险。
- 鲁棒性:对抗性威胁和分布外鲁棒性。
-
评估指标与工具
- 基于规则:如BLEU、ROUGE。
- 基于机器学习:BERTScore、BLEURT。
- 基于LLM:如GPT-judge、LLM-Eval。
- 人类评估:如AIS、FActScore。
- 数据集:如RealToxicityPrompts、HELM、DECODINGTRUST。
四、实践案例分析
-
大语言模型安全性评估
- HELM:多维度评估框架。
- Trustworthy LLMs:涵盖可靠性、安全性、公平性等29个子类。
- DecodingTrust:全面评估框架。
- SuperCLUE-Safety:中国国内评估基准。
-
文生图与多模态模型
- HEIM:文生图模型评估基准。
- Unsafe Diffusion:分析不安全图像生成。
- T2VSafetyBench:视频生成安全性评估。
- MLLMGUARD:多模态模型安全评估套件。
五、展望
-
面向安全的大模型自主演进
- 自主监控与预警。
- 自我诊断与修复能力。
- 动态风险评估与适应性增强。
-
大模型评估的衍生安全风险
- 隐私泄露风险。
- 对抗性攻击风险。
- 评估环境的稳健性。
总结要点
生成式大模型的安全评估需要从伦理、内容、技术三个层面入手,涵盖偏见、事实性、隐私、鲁棒性等多个维度。通过构建多层次评估框架,并结合GPT系列、HELM等工具与指标,能够有效提升生成式大模型的可信度、安全性和合规性。未来,模型需具备自我诊断与动态适应能力,以应对复杂的使用场景和潜在风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载