2023-06-11-之江实验室-2023生成式大模型安全与隐私白皮书_60页_10mb
报告摘要
生成式大模型安全与隐私白皮书总结
序言与背景
生成式大模型(如ChatGPT和GPT4)在学术和工业界引发广泛普及和关注。尽管这些模型赋能变革,但也带来了一系列数据与模型安全、隐私泄露、伦理问题和产权争议。为此,白皮书旨在总结发展现状、分析安全隐患并提出解决方案,为政府决策和未来研究提供参考。
生成式大模型的发展之路
生成式大模型技术源于Transformer架构,随着参数量增加,GPT系列和BERT等模型迅速发展:
- 模型演进:GPT1开启语言模型探索,GPT2支持Zero-shot学习,GPT3支持In-context Learning,GPT3.5和InstructGPT使模型更具有泛化能力和安全性。
- 国际开源与应用:Meta LLaMa、Alpaca、通义千问、ChatGLM等模型百花齐放,展示了全球多模态交互和中文增强能力。
- 影响:OpenAI ChatGPT推动人机交互革命,各大机构融合生成式AI进入多领域赋能时代。
生成式大模型引发的变革
生成式模型已渗入各行业,并引发深层变革:
- 人机交互:如Windows集成ChatGPT实现智能输入法和多模态交互。
- 信息资源管理:用于大规模数据分析及内容检索(如摩根士丹利应用GPT4优化知识库)。
- 科学研究:支持论文撰写、润色、生物预测、加速结构建模(如苯乙烯材料抗菌层研发)。
- 内容创作:从自动写作到游戏开发和影视动画(如Netflix动画制作)。
生成式大模型存在的安全问题
生成式大模型面临多方面安全隐患:
数据安全与隐私泄露
ChatGPT等模型在训练中可能会导致:
- 隐私显式泄露:高频用户的敏感信息可能出现在其他用户的消息中。
- 隐式预测泄露:模型可能在训练数据提供的开销中延续原始用户偏好。
- 虚假信息传播:如ChatGPT被用于传播不实新闻或钓鱼邮件。
使用的规范问题
生成式大模型被恶意使用做:
- 虚假内容生成:如发帖诱导性语句、钓鱼或诈骗文本编写
- 违法行为:跨境武器销量询问、诽谤内容传播、侵犯个人名誉权等
- 蜂巢效应:模型被用于极端言论传播,如偏见陈述、种族歧视等
可信与伦理问题
生成内容可能存在以下问题:
- 内容不可信:模型输出答案有“一本正经地胡说八道”的风险。
- 价值观蔓延:模型可能在价值观引导下强化偏见或传播有害信息。
- 伦理规范缺失:如与患者交流没有医疗背景意识,严重偏离专业伦理。
产权问题
生成式模型内容的版权归属仍是未解之谜:
- 生成作品版权争议:AI不能作为主体拥有著作权。
- 侵权问题:ChatGPT训练数据来源不透明,可能涉及数据盗窃与知识产权侵犯。
- 维权的困难:侵权侵权主体难追溯,且用户需对成果负责。
模型安全威胁
包括:
- 模型窃取:攻击者通过最小次数查询推测目标模型。
- 数据窃取:通过多次输出推测模型训练数据。
- 对抗攻击、后门攻击、pent攻击等。
- 数据投毒:据训练阶段主动干预导致质量下降。
以上安全问题,构成了构建可信通用人工智能(AGI)过程中的关键障碍。
安全与隐私建议
为应对上述问题,白皮书提出多层安全策略:
保护数据隐私
- 安全存储用户对话记录。
- 采用差分隐私、联邦学习、加密技术保护训练中隐私。
- 设计具有隐私评估机制的生成模型。
模型安全问题处理
- 引入对抗训练机制检测恶意输入。
- 增强模型鲁棒,对黑盒攻、梯度泄露攻打备防御机制。
- 建立多级网络安全防护和模型水印系统。
合规与可信保障
- 应用AI模型复杂度评分机制,帮助用户评估可信度。
- 推动构建信任评价体系,专家与公众评价结合。
- 训练数据需明确注明来源于法律法规,提升内容符合度。
AGI与未来安全规划
白皮书也对未来AGI原则提出建议:
- 在多模态融合带来便利的同时也会加剧数据隐私暴露,需开发跨模态检测系统。
- 建立独立LLM评估社群,用机器间判断封堵恶性模型。
- 提前制定AI治理机制,对训练数据与模型进行合规审查。
- 实施全国性甚至全球性AI监管,统一数据安全标准。
- 合理防范AGI可能的对抗行为,推动AI安全性测试标准进一步完善。
综上所述,生成式大模型是AI发展的重要里程碑,但其广泛应用也具有复杂的伦理、安全与政策风险,需社会各界共同努力,推动安全、可信、伦理AI的可持续发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载