周世峰:大数据运维域数智运维能力实践_26页_8mb
报告摘要
基于AIops的智慧运营大脑探索与实践总结
核心内容
中国电信湖北公司基于AIops理念,探索并实践了“智慧运营大脑”项目,旨在应对IT系统上云后运维复杂度的显著提升,构建一个融合云、网、数、业、安的智能化运维体系,实现统一监控、智能调度、AI赋能与运维生态的全面升级。
主要观点
- IT上云带来的运维挑战:随着传统Oracle架构向全云化、全分布式架构演进,监控对象数量呈几何级增长,调用关系日趋复杂,传统运维手段难以应对。
- 智能监控体系构建:通过融合监控与智能监控,打通IaaS/PaaS/SaaS各层数据,实现统一采集、统一监控、统一展现、统一调度,构建跨云平台的监控体系。
- AI赋能运维能力:引入AI算法与知识图谱,实现动态阈值设定、故障趋势预测、根因分析和智能决策,提升运维效率和准确性。
- 运维生态建设:通过工具集市、知识共享等方式,推动运维能力的复用与协同,打造企业级运维能力平台。
- 元宇宙技术应用:利用元宇宙技术构建虚拟监控中心,突破物理空间限制,实现线上线下联动,提升自智处置效率和协同体验。
- 多场景应用案例:已在多个场景中落地实践,如政务云、政府热线等,实现云网融合、一体化监控和故障快速定位。
关键信息
一、研发背景
- 传统架构向云架构转型:IT系统从Oracle架构演变为全云化、全分布式架构,监控对象数量激增,传统运维手段已无法满足需求。
- 混合云运维挑战:PaaS层使用自有组件,IaaS层混合云部署,导致维护责任分散,故障关联分析困难。
- 业务生态圈变化:云原生架构要求运维手段与经验更新,原有监控模式难以实现先于客户发现问题。
二、从融合监控到智能监控
- 总体目标:构建“云-网-业-数-安”融合监控体系,实现统一纳管、智能调度、AI注智和运维生态。
- 统一采集与监控:
- 实现监控客户端统一,无需安装多个采集进程。
- 支持环境、数据库、中间件、应用、业务性能、应用日志、计划任务、交易等多维度监控。
- 关联监控模型:
- 构建从应用到主机的数字孪生模型,支持IaaS/PaaS/SaaS层的关联分析。
- 实现故障根因快速定位与反向预警,提高问题处理效率。
- 低代码可视化大屏平台:
- 采用“1+N+1”架构,实现多大屏应用与大脑统一监控。
- 已建成20余个大屏应用,涵盖云/网/数/业/安等关键业务场景。
三、智能调度中心
- 告警自愈:
- 通过大脑监控告警,智能匹配自愈策略,实现故障自动发现、自动调度和自动修复。
- 自动化处理流程:
- 告警触发后,自动匹配自愈规则并执行服务编排,提升运维响应速度。
四、AI中心
- 动态阈值与趋势预测:
- 引入统计检验、KNN、孤立森林、Prophet等算法,实现动态阈值设定与故障趋势预测。
- 知识图谱应用:
- 构建从SaaS到IaaS的全流程端到端监控图谱,支持故障根因分析与快速定位。
- 自然语言交互:
- 开发智能问答机器人、微信告警通知、语音外呼等多模态交互方式,提升运维响应效率和用户体验。
五、运维生态建设
- 工具集市:
- 支持低代码开发运维工具,形成工具共享机制,降低运维门槛。
- 知识共享:
- 建立企业级运维知识库,结合大语言模型实现智能搜索,提升知识利用效率。
六、总体架构与部署模式
- 架构设计:
- 采用“六中心一门户”架构,包括统一门户、基础配置中心、智能监控中心、智能调度中心、AI中心、智能工具中心和智能知识中心。
- 部署模式:
- 采用“1+X”两级部署,支持SaaS版本(智慧运营大脑)和私有化部署(行业运营大脑)。
- 两种部署模式在安全保障、网络需求、适用场景等方面各有侧重,满足不同客户需求。
七、应用案例
- 某市卫健委融合监控-云专线监控:
- 实现对多云资源、网络专线的一体化监控。
- 利用图数据库动态生成物理链路拓扑图,实现告警收敛与可视化。
- 某市政务云融合监控:
- 基于腾讯云底座,实现政务外网区和互联网区的一体化监控。
- 覆盖127平台宿主机和242台云主机,监控漏洞与性能指标。
- 政府热线监控:
- 实现对市民热线专线、云主机及主要业务系统的融合监控。
- 监控接通率等关键指标,确保服务稳定性。
总结
智慧运营大脑项目通过融合监控与智能监控,有效应对了IT系统上云后的运维挑战,提升了监控效率与智能化水平。其核心在于构建统一的监控体系、引入AI算法与知识图谱、打造低代码运维工具集市,并结合元宇宙技术实现虚拟监控中心,为未来运维模式提供新思路与新体验。同时,通过多个实际案例验证了其在云网融合、故障根因定位与智能调度方面的可行性与价值。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载