2024-01-01-商汤科技_中国信通院-2023大模型可信赖研究报告_48页_2mb
报告摘要
大模型发展现状概述
- 技术引擎:作为深度学习的典型代表,大模型在自然语言处理、多模态应用等领域取得突破,正成为推动新一轮科技革命的核心引擎。
- 产业赋能:加速向“大模型+”模式演进,应用领域广及能源、金融等多行业,助力传统产业智能化转型。
- 治理体系:全球范围加强治理监管,中国主张“包容审慎”原则,欧盟侧重风险分级,美国强调安全与创新并重。
大模型风险全景视图
大模型的可信赖议题集中于四大风险维度:
-
框架脆弱性
- 深度学习框架存在软件漏洞、恶意攻击及运行环境不可靠等问题,威胁模型训练和推理的稳定性与安全性。
- 攻击向量包括物理攻击、网络渗透、容器逃逸等。
-
数据质量隐患
- 训练数据来源复杂,面临来源不可靠、隐私泄露、有害内容、数据偏见、样本量不足等多重风险。
- 特别是数据脱敏和去偏见技术仍是数据治理流程的关键难点。
-
模型安全性缺陷
- 大模型易受提示词攻击(提示泄露、目标劫持、越狱);对抗性干扰可见其脆弱性不足;知识产权与伦理偏见构成威胁。
- 在生成内容层面,“幻觉”现象导致事实错误、逻辑冲突、与上下文冲突是核心挑战,且生成内容与社会主流价值观冲突。
-
内容追溯难题
- 缺乏有效机制对“幻觉”及有害生成内容进行识别和溯源;侵权内容归属难题在法律与技术层面均待解。
- 数字水印和内容检测是主要的技术响应,但仍有相当挑战。
大模型可信赖实践方案
-
框架层面
- 采用漏洞检测、访问控制、可信执行环境(TEE)、数字加密策略,确保大模型运行环境安全可信。
-
数据层面
- 实施全生命周期管理机制,包括数据来源审查、去敏感、有害内容去除、倾斜统计分析及偏见修正。
-
模型层面
- 针对性训练、思维链(Chain-of-Thought)和RLHF技术以提升模型能力,通过检测工具排查模型偏差、越权访问等问题,构建投诉反馈机制及风险监控平台。
-
生成内容层面
- 过滤与标识机制配合数字水印技术,为内容审核与监控提供基础,实现内容溯源、版权保护、偏见规避等目标。
总结与建议
大模型安全、可靠的运行对可持续发展至关重要,但仍面临技术黑箱、治理框架不完善的双重挑战。为建设健康的大模型生态系统,建议:
- 技术发展:聚焦可解释性、价值对齐研究,构建协同技术生态。
- 生态构建:建立权威的大模型测试体系和行业共识,保证评测标准化。
- 治理完善:采用“包容审慎、分类分级”原则,探索科学风险治理体系。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载