_人工智能安全风险测评(2025年)_白皮书_115页_2mb
报告摘要
人工智能安全风险测评(2025年)白皮书总结
核心内容
《人工智能安全风险测评(2025年)》白皮书由中国信息安全测评中心联合多家机构共同编写,旨在推动人工智能安全风险测评体系的构建,实现“测—评—反馈—迭代”的安全闭环,促进人工智能技术的“安全可控”与“创新发展”动态平衡。白皮书聚焦大语言模型(LLM)及基于其构建的复合系统,从系统全生命周期出发,提出“安全性、可靠性、可控性、公平性”及“可审核、可监督、可追溯、可信赖”等治理要求,并构建了人工智能安全风险分析框架与测评体系,以应对人工智能快速发展带来的复杂安全挑战。
主要观点
1. 人工智能发展与安全的动态关系
- 人工智能技术发展迅速,成为新一轮科技革命和产业变革的战略力量,但也带来了前所未有的安全风险。
- 各国纷纷采取差异化治理措施,以确保人工智能发展与安全并重,提升技术安全能力与治理水平。
2. 人工智能安全风险的特征
- 多维复杂性:风险涉及技术、伦理、法律、社会等多个层面。
- 动态演进性:风险不断变化,需持续监测与评估。
- 系统性影响:一个核心组件的漏洞可能影响整个系统,形成“单点故障,全域崩溃”的局面。
3. 人工智能安全风险测评体系构建
- 测评体系基于“目标设定—内容实施—方法技术—对象覆盖—风险度量—持续优化”的反馈控制逻辑。
- 测评内容覆盖技术、内容、伦理、供应链等维度,形成全领域安全覆盖。
- 测评方法包括基于规则、对抗、指标、场景、数据、机器学习、形式化验证等,实现多元化技术路径。
- 测评对象贯穿系统全栈分层,涵盖应用层、模型层、数据层及设施层。
- 风险度量通过综合风险得分模型,将风险分为红、橙、黄、绿四个等级,便于分级管理与应对。
关键信息
一、测评目标
- 安全性:保障系统免受恶意攻击与技术扰动。
- 可靠性:确保系统在正常及边缘场景下输出准确、稳定。
- 可控性:实现对系统行为的可预测、可干预与可终止。
- 公平性:确保系统在设计与输出中不产生歧视或偏见。
二、测评内容
- 技术安全:包括对抗鲁棒性、抗窃取能力、动态稳定性等。
- 内容安全:防范生成虚假信息、违法内容等。
- 伦理安全:确保系统符合社会伦理与法律规范。
- 数据安全:涵盖数据采集、存储、使用与销毁的全流程安全。
- 模型安全:包括模型训练、部署、优化及版本管理。
- 供应链安全:覆盖硬件、软件、模型及第三方服务的全链路安全。
三、测评方法与技术
- 基于规则的基线测试:识别并评估系统是否存在已知风险点。
- 基于对抗的红队测试:模拟攻击行为,验证系统防御能力。
- 基于指标的量化评估:通过具体指标衡量系统安全状态。
- 基于场景的仿真评估:在实际业务场景中测试系统表现。
- 基于数据的行为评估:分析模型在数据交互中的行为模式。
- 基于机器学习的自适应:利用模型自身能力进行安全评估。
- 基于形式化验证的逻辑:验证系统行为是否符合预期逻辑。
四、测评对象
- 基础设施安全:涵盖硬件、算力、网络、存储等。
- 数据安全:关注数据采集、处理、存储、传输与销毁。
- 模型安全:涉及模型架构、训练、验证、部署与更新。
- 应用与智能体安全:包括权限控制、接口安全、业务流程安全等。
- 用户与身份安全:防范身份冒充、会话劫持、权限滥用等。
- 内容安全:确保生成内容符合法律、伦理与合规要求。
五、风险度量与管理
- 风险度量采用综合风险得分模型,根据威胁严重性、影响范围与可修复性进行量化评估。
- 风险等级分为:红(9-10分,致命风险)、橙(6-8分,高风险)、黄(3-5分,中风险)、绿(0-2分,低风险)。
- 测评体系强调闭环优化,通过“测评实施—风险度量—内容优化—再测评”形成持续改进机制。
测评实践与工具
1. 公共机构测评平台
- 美国 Dioptra:开源测评平台,覆盖多种安全指标。
- 英国 Inspect:评估框架,支持模型代理能力与高危场景测试。
- 新加坡 Moonshot:开源评估工具包,融合基准测试与红队攻防。
2. 厂商测评平台
- Microsoft Azure AI:提供风险与安全评估器及红队代理。
- Google Cloud Vertex AI:集成内容安全与评估服务,支持自适应评估。
- Amazon Bedrock:提供模型评估与RAG评估能力,实现业务场景下的综合测评。
3. 红队攻防评测工具集
- PyRIT:生成式AI红队基座型框架,支持攻击与评估流程。
- Garak:结构化漏洞扫描工具,支持多种攻击向量检测。
- DeepTeam:系统化测评框架,支持多类漏洞检测。
- Promptfoo:集成开发运营流程的红队与评估框架,支持自动化评分与报告。
- ViolentUTF:集成化测评平台,支持多角色协作与复杂流程执行。
结构安排
白皮书共五章,涵盖人工智能发展与安全、安全风险分析、测评体系构建、测评关键技术、未来展望等方面,形成完整的测评框架与实施路径。
参编单位与指导人员
参编单位包括中国信息安全测评中心、北京奇虎科技、北京中测安华、北京智谱华章、合肥讯飞数码、中科院自动化所、中科院信息工程所、启元实验室等。指导人员包括于洋、山世光、王可臻、王笑尘、王梦月、尹芷仪、石竑松、叶润国、冯俊兰等。
未来展望
- 技术发展:强调从“行为对齐”向“认知对齐”跃迁,确保模型在推理过程中与人类价值观一致。
- 标准建设:推动“分类分级管理”与“风险等级测试评估体系”建设,实现标准统一。
- 挑战应对:需应对“对抗性攻击”“多模态安全风险”“智能体自主性”等新挑战,构建动态、敏捷、多元的测评体系。
总结
白皮书系统梳理了人工智能安全风险测评的理论基础与实施路径,提出了涵盖全生命周期、多维度融合的测评体系,强调“测—评—反馈—迭代”的闭环管理机制。通过整合技术安全、伦理合规、系统可控等维度,推动人工智能安全治理的落地与实施,助力我国在全球人工智能安全测评领域发挥更大作用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载