乔彦辉:大模型在华为云数字化运维的全面探索和实践-26页_2mb
报告摘要
华为云智能运维大模型探索与实践总结
一、华为云智能运维发展路线
华为云经过多年发展,构建了完善的大规模AIOps体系,从最初的单点分析开始,逐步拓展至复杂场景下的自动化运维。早期阶段聚焦日志分析、指标异常检测和告警压缩等基础能力,随后逐步引入人工智能模型,提升网络、硬件和变更管理的智能化水平。近年来,华为云聚焦串并联智能运维,实现了运维流程的广泛自动化,并最终转向基于大语言模型(LLM)的运维Copilot,构建对话化智能决策架构,推进人工操作向AI辅助自动化演进的进程。
二、大模型使能运维核心规划
华为云选择聚焦高门槛、高人力消耗的核心场景,如故障处理流水线与事件单管理,通过构建盘古助手和运维Copilot Stack来提升运维人效。重点任务包括2000+故障处理场景、10000+事件处理能力的自动化,目标是将运维工作从重复性任务中解放出来。
运维Copilot Stack由小模型驱动确定性量化分析与大模型执行内容理解生成构成,结合知识库与向量索引,实现多轮意图理解、自动问答、智能根因诊断等功能。同时,构建多触点集成系统,支持Web端、企业微信机器人与运维工具的无缝整合,显著提升用户使用便捷性。
三、大模型落地难点与应对方案
-
运维语料少、知识质量差
通过数据增强技术,采用大模型合成模拟数据,并对真实事件、问答、工单等进行标注。同时建立冷启动语料集,确保初始数据集的真实性和覆盖率,构建持续向量化知识库,提升语料利用率。 -
知识治理挑战
建立知识图谱和知识地图,依托流程规范、产品说明书及内部案例库,统一制定运维知识管理流程。划分类事件、规范、产品使用等多维知识体系,提升知识可检索性与支持效率,并实现知识全生命周期管理。 -
高不确定性意图识别
采用多层路由机制,引入小模型进行意图分类与大模型内容生成结合,并新增纠偏层处理错误意图。通过BadCase集标注和标注意图改写策略,提高意图识别准确率达80%。 -
大模型幻觉与RAG有效性不足
引入提示词工程与问答对调优方法,结合向量检索与关键词搜索,拉通RAG多路检索结果改进模糊问题的理解能力。通过意图改写与问题标准化,使得AI回答准确率从30%提升到70%以上。 -
复杂编排与协同决策
构建确定性编排框架,实现小模型(负责根因定位)与大模型(生成解决方案)协同,借助思维链(Chain of Thought, COT)调用算法、知识图谱辅助执行链推理任务,完成从告警根因诊断到压缩、定位、推荐的一体化预测任务。
四、驱动智能运维无人化演进
华为云运维助手已实现智能路由触发、自动化处理、作业流嵌入等,显著改变运维交互模式,覆盖运维人员30%以上,整体人效提升20%以上。其未来规划是打造“运维智能中枢”,通过盘古大模型、智能算法、多Agent协同、数据底座等构建统一决策引擎,实现故障处理、事件调度和变更控制的无人操作。
总结趋势与规划层面,华为云将发展路径分为三阶段:辅助运维 -> 运营工作流集成 -> 运维数字助理;而大模型与AIAgent协同将是未来核心技术架构演进方向,以推进自动化向无人化深化发展。
试读结束,高清完整版pdf/doc/ppt,请点下载