智能体监督的未来_64页_19mb
报告摘要
未来智能体监督 (Agentic Supervision) 报告总结
引言
- Agentic AI (智能体) 极具潜力,能完成多项任务并自我调整,但比传统软件更不稳定。其预测性低的特点要求更高的"智能体监督"。
Agentic AI 的挑战
- 风险增加: 与传统软件不同,Agentic AI 行为不可预测,带来更多监控、合规和治理挑战。
- 新问题: 需要持续监控输入输出,解释行为,评估风险,并将监督嵌入到开发设计中。
- 新工作类型: 智能体监督是未来与 AI 协作的关键工作。
- 治理缺口: 已有治理模型依赖确定性输出和测试,而 Agentic AI 输出是概率性的。
- 监督需求: 监督不仅仅是技术问题,更涉及到审批、输入、输出、性能、安全等多个维度。
监督框架 (AgentOps 堆栈)
预期可构建一个类似 DevOps/MLOps 的三级框架:
- 前期测试: 验证智能体质量,在生产部署前。需要处理高度变异性,使用 LLMs 判别器、比较人工标注数据集等,但自动化测试是关键挑战。
- 运行时防护: 智能体运行时的控制层。需防范意外提示、数据泄露、不当输出等。
- 后期观察: 运行后监控、评估、优化。包括实时响应、战略时间的行为分析。
- 工具: 涉及新型测试、评估、警报和管理工具,如 Giskard, Langfuse, DeepEval,支持评估、观察、响应循环。
优秀工具案例
- Giskard: 全栈评估和监督。
- Langfuse: 细粒度追踪、评估。
- DeepEval: LLM 评估指标。
- Robust Intelligence: 负面测试/安全。
- Weights & Biases: 实验和运行时治理。
隐患示例
提到了三个智能体引发的问题:
- 准确性事故:CRM 智能体发送了不合适的信息。
- 隐私事故:内部法律智能体泄露了敏感信息。
- 提示注入事故:供应商分析智能体被篡改指令。
关键因素:治理与业务参与
- 非黑即白模型不足: 需要平衡价值与风险,监控负面影响,并进行纠正。
- 业务参与: 技术团队需定义成功与风险指标,而业务团队必须参与设计、承担最终责任、参与日志维护。
- 工具使用: 技术团队负责评估和运维,业务团队负责审批和追求价值。
- 风险责任: 隐私、合规等风险的最终责任归属尚不明确,需要定义清晰的角色和清单编辑。
建议步骤
- 从零开始构建: 让优秀工程师参与治理,采用可操作的工具,澄清风险责任。
- 采用智能体模型: 每个项目都要考虑其风险,并定义清晰的路径。
- AI 与 治理 相结合: 将数据治理嵌入智能体生命周期中。
Agentic Supervision 是一项新兴技术,技术团队和人力资源均已到位,需要深度参与。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载