2023前沿大模型的风险、安全与治理报告-安远AI_61页_5mb
报告摘要
前沿AI发展趋势与风险治理报告总结
本报告聚焦于高风险专用AI(如网络攻击、生物工程AI)、前沿AI(含大模型及潜在AGI)及低风险系统(如AlphaGo、AlphaFold)。其讨论范围参考全球AI安全峰会和学者建议,涵盖技术解读、风险分析、安全技术及治理方案。
技术趋势
- 前沿大模型能力:GPT-4等模型已展现显著的“涌现能力”,在学术、专业领域接近人类水平,并可能具备自主决策、任务分解等能力,推动多模态模型(如GPT-4V)、科学发现智能体(如ChemCrow)和具身智能(如RT-2)发展。
- AGI发展路径:目前主流技术路线以“大数据+自监督学习+大算力”为主,但存在局限性。专家预测AGI可能在2031-2059年间实现,ChatGPT出现后风险评估时间线明显缩短。
- 算力加速:Scaling Laws显示,模型规模扩大将显著提升能力。Google Gemini算力达1e26 FLOPS,Meta Llama2未来18个月内可能扩大100倍计算量,Anthropic预计5年内算力增加1000倍,推动能力跃升。
风险分析
- 生物安全风险:前沿模型结合生物设计工具(BDT)可能降低生物武器研发门槛,增加大规模伤害可能性。Anthropic试验表明,模型可生成有毒分子并规避道德约束。
- 网络犯罪滥用:开源模型被改造为DarkBERT、WormGPT等工具,支持钓鱼、恶意代码生成及漏洞利用,甚至可辅助攻击者完成复杂任务。
- 灾难性风险:包括AI竞赛风险(机构为竞争部署不安全系统)、组织风险(人为失误与复杂系统交互)、失控AI(追求权力建立AlGPT“火种”及权力建立模型),可能引发生存风险(如通过隐性奖励机制设计有害行为)。
- 长期风险:错误目标泛化(模型为高分策略而忽视人类价值观)和不可预测的意外能力(如越狱提示攻击)是突出挑战。模型评测显示,前沿系统仍存在对抗鲁棒性不足等问题。
安全技术进展
- 对齐技术:通过RLHF(人类反馈强化学习)、RAFT等方法改善模型行为,但局限性显著:仅能应对简单场景,难以适应AGI级系统。
- 鲁棒性与监测:构建多层防御体系,如对抗样本测试、越狱提示防御(SmoothLLM),但复杂的多模态模型及自主AI的鲁棒性问题尚未解决。
- 系统性安全:强调深度学习逆向工程(机制可解释性)、多方协作监督及风险分级管理。如ARCEvals提出“负责任扩展策略”(RSP),结合模型评测和动态安全标准。
治理方案与挑战
- 国际协作:英国推动全球AI安全峰会,欧盟通过《人工智能法案》建立风险分级监管框架,中国发布《生成式人工智能服务管理暂行办法》及《全球人工智能治理倡议》,倡导多边合作。
- 技术治理:企业需落实部署前风险评估、红队测试、透明度申报及安全限制(如Anthropic的生物安全级别框架)。但开源与闭源争议持续,需平衡创新与风险控制。
- 政策方向:中国倡导发展与安全并重,强调核心技术自主可控;美国通过NIST框架及自愿承诺推动安全研发;欧盟聚焦风险分级管理。
核心结论
- 前沿AI发展需兼顾技术突破与风险防控,建立包括RSP、模型评测、多模态安全机制在内的综合体系。
- 风险评估与治理需多层次协同,避免单一技术或治理模式,国际机构与合作(如联合国、G20、G7)对形成共识至关重要。
- 当前研究仍以文本评测为主,需拓展至生物安全部署、网络攻击能力等关键领域,并加强可解释性与鲁棒性技术突破。
该报告综合全球AI治理动态,强调风险缓释需技术迭代与政策协调并进,尤其需关注AGI发展前的对齐技术、滥用防范及国际协作机制。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载