前沿人工智能安全的最佳实践:面向中国机构的研发实践案例与政策制定指南-人工智能合作与治理国际论坛-2024.1-77页_3mb
报告摘要
执行摘要
全球人工智能安全已成为国际社会重点关注的议题。2023年多场国际会议上,中、美、欧盟达成多项共识与倡议,强调人工智能发展需兼顾安全与伦理。报告聚焦“前沿人工智能”的安全实践,提出九项关键措施,并提供全球机构案例与政策建议。
核心议题
- ⬉ 全球重视AI安全
- 中国宣布《全球人工智能治理倡议》,联合国组建人工智能高级咨询机构,28国签署《布莱切利宣言》,呼应前沿AI潜在风险防范共识。
- ⬉ 中国语境的挑战
- 从政策到研发如何将“技术治理”落地,构建兼顾创新与风险控制的中国方案。
最佳实践与案例
(1)九项安全实践
- 模型评测
- 方式:持续性渗透测试、多维度基准打分
- 案例:清华发布SafetyBench,上海实验室开发OpenCompass
- 风险研究
- 开源投入至少30%的研发经费,需系统评估模型滥用风险
- 案例:OpenAI投入20%算力推进“超级对齐”研究
- 其他七项涵盖:模型权重保护、漏洞赏金机制、内容标识、信息共享框架、滥用监护及 负责任扩展策略。
(2)核心机构案例
- 🥌 Anthropic:发布"人类安全级别(ASL)"框架,分阶段设定安全阈值策略。
- 🥌 微软:2023年定为AI安全元年,推出漏洞赏金及模型卡制度,限制“越狱攻击”
- 🥌 OpenAI:推出《准备框架Beta》与安全记分卡系统,动态跟踪模型风险。
政策建议
- ✅ 建立覆盖全生命周期的纵深防御策略
- 需闭环贯穿“算法备案—风险评估—安全测试—事件溯源”
- 🏭 打造国产化AI安全测试机构
- 借鉴英国生物安全等级标准构建ASL认证系统
- 📉 加快AI安全从研发驱动到政策与技术联合治理
- 例如推动“AI治理试验区”建设、“人机共同决策”机制等工作。
结语
人工智能爆发期既是机遇,也是挑战。报告将“尽职安全”理念落地为国际通行、本地化实施的最佳实践路径,号召各方共建“可解释—可追溯—能控制”的前沿AI安全生态。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载