人工智能安全风险测评白皮书(2025年)_115页_2mb
报告摘要
人工智能安全风险测评(2025年)白皮书总结
核心内容
《人工智能安全风险测评(2025年)》白皮书系统探讨了人工智能安全风险测试评估的实施路线,旨在推动人工智能产业形成“测评—反馈—迭代”的安全闭环,实现“安全可控”与“创新发展”的动态平衡。白皮书聚焦以大语言模型(LLM)为核心的人工智能系统,覆盖其全生命周期,包括系统规划与设计、数据采集与处理、模型训练与构建、模型验证与确认、平台部署与集成、系统运行与监测、用户使用与影响等环节。
主要观点
-
人工智能安全风险特征:
- 动态性:人工智能系统的风险具有不可预测性,需持续评估与监控。
- 对抗性:攻击者利用人工智能的自主性,发展自动化攻防技术,形成“军备竞赛”。
- 系统性:风险具有广泛影响,可能通过软件供应链迅速扩散至全球应用。
-
人工智能安全风险框架:
- 提出“全景视图”分析框架,涵盖七个生命周期阶段与五大关键维度。
- 构建“风险定位—攻击分析—目标对标”的三层闭环逻辑,实现对人工智能系统全链路安全评估。
-
测评体系构建:
- 以“目标设定—内容实施—方法技术—对象覆盖—风险度量—持续优化”为闭环链路。
- 测评目标包括“安全性、可靠性、可控性、公平性”等,细化为六大维度,覆盖技术安全、内容安全、伦理安全、供应链安全等。
-
测评对象与内容:
- 测评对象涵盖“应用层、模型层、数据层、设施层”等。
- 测评内容包括“基础设施安全、数据安全、模型安全、应用与智能体安全、用户与身份安全、内容安全、合规与伦理风险、管理类风险”等。
-
测评方法与技术:
- 采用“输入层测试、训练层测试、模型层测试、输出层测试、部署层测试”等技术路径。
- 引入“红队攻防”与“漏洞扫描”等工具,实现对人工智能系统的全面检测。
关键信息
测评体系结构
- 测评目的:锚定“安全性、可靠性、可控性、公平性”四大目标。
- 测评内容:涵盖技术安全、内容安全、伦理安全、供应链安全等维度。
- 测评方法:包括对抗样本测试、模型窃取、提示注入、数据投毒等技术手段。
- 测评对象:覆盖人工智能系统的全栈分层,包括应用层、模型层、数据层、设施层。
- 风险度量:采用四级风险划分(红、橙、黄、绿),实现风险量化评估。
- 持续优化:通过反馈机制不断迭代测评内容与方法,形成“测评—风险度量—优化”的闭环。
测评技术与工具
-
公共机构测评平台:
- Dioptra(美国):提供标准化测试环境,覆盖多种安全指标。
- Inspect(英国):采用“任务—数据集—求解器—评分器”架构,实现模型评估。
- Moonshot(新加坡):融合基准测试与红队攻防,支持全球开发者使用。
-
厂商测评平台:
- Microsoft Azure AI:提供风险与安全评估器、红队代理等工具,实现全流程安全治理。
- Google Cloud Vertex AI:集成内容安全过滤与风险评估,支持策略配置与评估联动。
- Amazon Bedrock:提供模型评估与RAG评估能力,支持业务场景中的综合测评。
-
红队攻防工具集:
- PyRIT:开源红队框架,支持自动化风险识别与评估。
- Garak:结构化漏洞扫描工具,识别模型在内容生成、训练数据泄露等方面的风险。
- DeepTeam:支持对多种大语言模型应用进行安全性与脆弱性评估。
- Promptfoo:集成开发运营流程,支持提示测试与红队评估。
- ViolentUTF:提供统一框架与交互界面,支持复杂红队流程执行。
测评展望
- 发展趋势:从“技术驱动”转向“目标驱动”,强调对人工智能系统的全面、动态测评。
- 测评标准:推动国际标准协同共建,构建统一的测评体系。
- 应对挑战:聚焦技术、伦理、治理等多维度,应对人工智能安全测评的复杂性与不确定性。
参与单位与人员
- 参编单位:包括中国信息安全测评中心、奇虎科技、中测安华、智谱华章、讯飞数码、中科院自动化所、信息工程所、启元实验室等。
- 指导与编写人员:涵盖多位专家与学者,按姓氏笔画排序,包括于洋、山世光、王可臻等。
总结
《人工智能安全风险测评(2025年)》白皮书为人工智能安全测评提供了系统性框架,推动测评从“静态”向“动态”转变,从“单一”向“多维”拓展。通过构建“全栈覆盖、多维度融合、标准统一”的测评体系,实现对人工智能系统全生命周期的全面覆盖与精准评估,助力人工智能产业安全可控与创新发展并行。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载