2024前沿人工智能安全的最佳实践-面向中国机构的研发实践案例与政策制定指南-安远AI_77页_4mb
报告摘要
为应对前沿人工智能(FrontierAI)潜在风险,多国及中国已采取多项措施:
2023年10月,中国发布《全球人工智能治理倡议》,倡导国际协作,建立安全、可靠、可控与公平的治理框架。11月,中国、美国、欧盟等28国签署《布莱切利人工智能安全宣言》,强调需防范AI在网络安全、生物技术、虚假信息等领域引发的重大风险。国际层面,联合国成立“人工智能高级别咨询机构”,推动系统性治理。国内政策方面,2023年7月国家网信办等七部门发布《生成式人工智能服务管理暂行办法》,2023年4月中央政治局会议要求强化AI风险防控,推动技术发展与治理的平衡。
前沿AI安全主要涉及九类实践措施:
- 模型评测与红队测试:通过多维度评测(如安全、偏见、价值观对齐)识别风险,结合红队测试模拟攻击。例如清华发布SafetyBench基准,上海AI实验室开展OpenCompass评测;DEFCON挑战赛评估模型是否易被攻破,部分企业将此类实践纳入合同要求。
- 优先研究AI风险:专注模型的网络安全、偏见、隐私等研究,探索防御工具(如水印技术、安全提示机制)。OpenAI投入20%算力研究“超级对齐”,Anthropic通过RLHF方法优化模型安全。
- 安全控制与保护模型权重:实施网络安全、物理安全及人员培训,如Anthropic采用“多方控制”,AWS限制数据中⼼访问权限。中国《关键信息基础设施安全保护条例》将AI纳入关键领域监管。
- 漏洞报告与披露机制:建立漏洞管理流程,如微软漏洞赏金计划,奖励企业报告漏洞。中国工信部等联合发布《网络产品安全漏洞管理规定》,要求漏洞信息共享。
- AI生成材料的标识:通过水印、元数据、标签等技术标识内容来源,避免混淆。Meta开发StableSignature水印,阿里塔玑采用明文/暗文水印,全国信安标委提出《生成式AI识别方法》。
- 模型报告与信息共享:公开模型风险评估、训练数据与安全措施。中国《人工智能示范法》提出负面清单制度,美国《国家安全行政命令》要求高风险模型共享数据处理信息。
- 防止与监测模型滥用:部署输入输出过滤器,实施API访问限制,制定回滚与撤回计划。微软通过红队测试识别滥用模式,Anthropic将AI安全与社会风险评估结合。
- 数据输入控制与审核:审核训练数据的质量与风险,如OpenAI过滤仇恨言论及非法内容,国内CCI语料库严格清洗数据并去除评测集。
- 负责任扩展策略(RSP):设定风险阈值,在达到安全要求前暂停扩展。Anthropic沿用BSL生物安全级别概念,定义ASL层级并对应强化安全措施;OpenAI发布“准备框架”监测风险进展,推动模型分级管理。
国内实践:
- 北京、上海、广东发布AI发展规划,明确伦理与安全评测要求,如北京建设评测开放平台,上海建立测试验证中心,广东开展多维度安全研究。
- 高校及研究机构推动安全研究,如清华、阿里等团队开发RRHF方法,北大发布SafeRLHF框架;AI机构需平衡安全与创新,支持行业自控与政策制定协同。
挑战与建议:
- AI风险具有高度不确定性,需持续投入研究与技术升级,如行业设立专门评测机构,优化动态安全评估机制。
- 建议构建多层次安全体系(如纵深防御策略),完善法律框架,强化技术治理,并探索具有中国特色的AI治理模式(如关键基础设施安全保护、试验区建设)。
- 通过国际合作(如AI安全峰会)借鉴最佳实践,推动AI发展与社会责任的统一。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载