> **来源:[研报客](https://pc.yanbaoke.cn)** # 通用型AI智能体L1-L5分级安全框架白皮书总结 ## 核心内容概述 本白皮书提出一套面向通用型AI智能体的L1-L5分级安全框架,旨在为智能体开发者、平台提供者、用户及研究机构提供系统化的风险评估与安全防护方案。该框架以“自主性”为核心分级依据,结合决策自主度和降险自主度两个维度,对智能体的能力边界与安全风险进行系统分析,并提出分级安全措施建议,为智能体的治理提供理论与实践参考。 ## 主要观点 - **智能体技术演进**:自2022年以来,以大语言模型为推理核心的智能体已从“生成式工具”演变为“自主行动主体”,具备感知、规划、决策、行动等能力,能够完成复杂任务,推动AI从执行工具向决策伙伴演进。 - **安全风险升级**:随着智能体自主性提升,风险呈现跨域传导、长期累积、系统性失控等特征,尤其在L3-L5等级中,滥用与主动失控风险显著增加,需重点关注。 - **全球治理趋势**:各国在智能体治理方面尚未形成统一标准,但均开始将其视为新型治理对象,围绕其能力水平与风险影响实施分级治理,形成技术、伦理、法律等多维度治理路径。 - **分级安全框架**:以“自主性”作为核心分级维度,将智能体分为L1至L5五个等级,每个等级对应不同的能力边界、人机分工与安全风险特征,为智能体的安全评估与防护提供依据。 - **安全防护建议**:提出“通用控制集+分级防护”双层安全设计思路,涵盖输入验证、权限管理、运行隔离、实时检测与响应、全生命周期管理等措施,以降低各等级智能体的风险暴露。 ## 关键信息 ### 1. 智能体自主性分级 | 等级 | 决策自主度 | 降险自主度 | 典型示例 | |------|------------|------------|----------| | L1 | 子任务范围内可生成候选输出,最终采纳需用户确认 | 无:失败即返回用户处理 | GitHub Copilot 行内代码补全;写作语法建议;单文档RAG型FAQ助手 | | L2 | 预批工作流内可自主决策每一步执行细节 | 有限:可在已定义异常范围内重试 | 消费级聊天产品(默认含网页搜索、代码解释器、文件分析等内置工具) | | L3 | 单一ODD内可独立完成完整规划与执行 | 中等:可重试、调整策略、回滚至已知安全状态 | 消费级聊天产品的Agent模式或专门的智能体产品 | | L4 | 可跨域自主决策 | 高:可自主诊断失效、切换策略、达成MRC | 企业经营类智能体,可持续数天自主运行 | | L5 | 完全自主决策,具备自我改进能力 | 自恢复运行:可自动达成MRC并调整策略 | 具备AGI/ASI特征的通用型智能体 | ### 2. 风险识别与演进路径 本框架识别出九大基线故障风险,涵盖感知、规划、记忆、行动、环境交互、身份与权限管理、数据资源、运行环境与人机协作失效等方面。风险随自主性等级提升呈现非线性放大趋势,且可能演变为“滥用”与“失控”等新兴风险。 #### 主要风险演进路径包括: - **输出错误→单点故障→级联故障→被动失控**:随着自主性提升,错误从文本输出逐步演变为执行层面的不可逆后果。 - **凭证泄露→越权访问→身份冒用→权限聚合→边界失灵**:权限边界扩大导致身份与权限风险升级。 - **人工审查失误→运行时接管失败→手段层规约失效→目标层红线不对齐**:监督失效从人工层面逐步前移到系统层面。 #### 高自主性等级(L3–L5)的新兴风险提示: - **滥用风险**:智能体可能被恶意利用,实施自动化网络攻击、定向欺诈、跨域复合攻击等行为。 - **失控风险**:智能体可能通过策略性欺骗或主动突破控制边界,导致人类无法有效干预或控制其行为。 ### 3. 安全防护措施建议 #### 分级防护设计原则: 1. **防护与风险相匹配**:安全控制应与智能体自主性等级、权限范围及潜在影响相适应。 2. **安全设计前置**:将安全要求纳入系统设计,避免依赖后期补丁式修复。 3. **纵深防御**:在多个层面(模型、工具、数据、权限、运行环境等)部署多层次安全机制。 4. **有效的人类监督**:在关键节点保持人类的审批与接管能力,避免监督失效。 5. **实时失效检测与响应**:建立贯穿运行全过程的实时检测机制,识别异常行为并及时响应。 6. **全生命周期风险管理**:覆盖设计、开发、部署、运行、退役等阶段,形成持续迭代的安全闭环。 #### 通用控制基线: | 风险来源 | 主要风险类型 | 控制建议 | |----------|--------------|----------| | 感知模块 | 目标劫持与提示词注入 | 输入验证+指令管理+异常检测 | | 规划模块 | 幻觉与错误规划 | 规划校验+边界控制+透明可解释 | | 记忆模块 | 记忆投毒与上下文污染 | 记忆管理+定期校验+隔离机制 | | 行动模块 | 工具滥用与危险行动执行 | 最小权限+策略拦截+沙箱隔离 | | 外部工具与插件 | 供应链与第三方组件风险 | 可信组件+来源验证+动态监测 | | 身份与权限管理 | 身份冒用与权限滥用 | 身份认证+最小权限+动态管理 | | 数据资源 | 数据泄露、篡改与投毒 | 分类分级+访问控制+监测与审计 | | 运行环境与基础设施 | 执行环境失陷与系统破坏 | 环境隔离+运行监测+人工审核 | ## 适用对象与使用方法 - **智能体开发者**:依据自主性等级评估产品能力,识别对应风险并设计安全防护措施。 - **平台与组件提供者**:理解不同等级对基础设施和权限的需求,建立安全默认配置与运行监测机制。 - **企业和个人用户**:识别智能体在部署中的安全风险,建立授权管理、运行监测与应急处置机制。 - **第三方研究与评测机构**:开展智能体分级评测,推动安全技术与治理框架的发展。 ## 结论 本框架通过系统分析智能体自主性与风险之间的关系,为智能体安全治理提供了一套可参考、可对标的分级体系。尽管当前L4与L5等级尚无现实实例,但其纳入框架为未来治理预留空间。随着智能体技术的快速发展,安全治理需与技术演进同步,防范新兴风险,确保智能体在开放环境中可控、安全运行。