> **来源:[研报客](https://pc.yanbaoke.cn)** # 智能体安全评测体系与实践白皮书总结 ## 核心内容概述 本白皮书由中国移动通信研究院等多家单位联合编制,旨在构建一套面向智能体系统的安全评测体系,以应对智能体在自主决策、工具调用、多轮交互和记忆管理等核心能力带来的新型安全风险。白皮书系统分析了智能体四层技术架构(感知、记忆、决策、执行)中的典型安全风险,并提出涵盖基模安全、交互安全、运行安全和基础安全的四大评测维度,构建覆盖智能体全生命周期的动态安全评测框架。 ## 主要观点 ### 1. 智能体安全风险特点 - **攻击面广**:涵盖多源异构输入、工具调用、记忆管理、执行链路等。 - **隐蔽性强**:如记忆污染、间接提示注入、多轮策略性绕过等攻击难以检测。 - **风险传导快**:从感知层到执行层的跨层污染与级联失效问题显著。 - **危害持久**:恶意数据可跨会话、跨任务持续生效,影响范围广泛。 ### 2. 智能体安全评测体系设计 - **基模安全**:评估模型本体的内生安全能力,如对抗样本防御、幻觉抑制、指令遵循等。 - **交互安全**:关注外部交互入口的安全,如越狱防御、参数注入、身份验证等。 - **运行安全**:聚焦智能体运行过程中的动态风险,如紧急关停、决策追溯、跨智能体合谋等。 - **基础安全**:涵盖执行层及系统环境的安全,如环境隔离、数据合规传输、敏感信息保护等。 ## 关键信息 ### 1. 智能体安全评测技术手段 - **对抗性行为模拟**:评估模型对攻击行为的抵御能力。 - **多轮策略压力测试**:检验智能体在复杂交互场景下的安全边界保持能力。 - **工具调用链路审计**:确保工具调用过程安全可控。 - **记忆数据隔离验证**:防止记忆污染和跨会话数据泄露。 ### 2. 智能体安全评测体系的结构 - **四层架构映射风险**:将 OWASP Agentic AI Top 10 风险与智能体技术架构进行双向映射。 - **评测维度清晰**:分为基模、交互、运行、基础四个维度,覆盖智能体全生命周期。 - **评测内容细化**:每个维度下设多个二级指标,实现安全风险的可定义、可量化、可治理。 ### 3. 评测实践与案例 - **评测对象**:以 OpenClaw 为例,验证评测体系的适用性。 - **评测环境**:包含聊天软件交互、模型推理、互联网资源、本地执行与管理配置等。 - **评测结果**: - **基模安全**:部分通过,但存在幻觉、指令边界模糊等问题。 - **交互安全**:存在越狱、参数注入、记忆污染等风险。 - **运行安全**:动态权限、任务终止、决策可追溯性等能力需加强。 - **基础安全**:数据合规传输、敏感信息保护、供应链安全等存在明显不足。 ### 4. 智能体安全评测的挑战 - 传统评测方法难以覆盖智能体动态行为链路风险。 - 智能体的自主性、多轮交互与记忆管理等特性增加了评测复杂度。 - 现有评测手段多为静态输出合规性检查,无法有效应对动态行为风险。 ### 5. 未来趋势与建议 - **分层权责化评测**:将安全评测嵌入研发流程,实现安全左移。 - **自动化红蓝对抗**:开发适用于智能体的自动化评测工具,提升检测效率。 - **供应链安全升级**:构建“代码物料 + 语义资产”双维风控框架。 - **动态风险权重机制**:根据业务场景设置不同风险等级与评测策略。 - **政企产学研协同治理**:形成“企业自测 + 第三方评测 + 监管复核”的三位一体安全治理架构。 ## 评测实践与结果分析 ### 评测对象 - **OpenClaw**:开源智能体框架,具备多轮交互、工具调用、本地执行等能力。 ### 评测内容 - **基模安全**:评估对抗样本防御、幻觉抑制、指令边界等。 - **交互安全**:包括越狱防御、参数注入、身份验证、操作一致性等。 - **运行安全**:涉及任务终止、决策可追溯、合谋防御等。 - **基础安全**:如环境隔离、数据合规传输、记忆完整性、身份认证等。 ### 评测结果 - **基模安全**:部分通过,但模型存在幻觉与对齐偏差问题。 - **交互安全**:存在越狱与注入风险,部分场景未完全拦截。 - **运行安全**:动态权限管理、任务终止等能力存在不足。 - **基础安全**:供应链管理、敏感数据保护、身份鉴别等存在明显缺陷。 ## 推进方向与建议 1. **合理收敛智能体默认能力边界**,对外部资源访问、命令执行等实施白名单与权限管理。 2. **建立清晰的信任边界**,对所有输入内容进行验证与过滤。 3. **加强敏感数据全生命周期保护**,在数据进入系统前完成识别、脱敏和最小化处理。 4. **强化高风险操作的执行约束**,建立确认、拦截与审计机制。 ## 结论 智能体安全评测体系的构建是推动AI产业安全落地的关键一步。评测体系应从静态合规检测转向动态行为可信管控,以应对智能体系统性风险。未来,评测体系将逐步实现标准化、自动化和体系化,成为智能体安全治理的基石。