【微博_黄阳全_】新浪微博云原生PaaS平台降本增效与稳定性建设实践_42页_9mb
报告摘要
微博云原生 PaaS 平台降本增效与稳定性建设实践总结
核心内容概述
微博云原生 PaaS 平台建设旨在通过降本增效与稳定性提升,优化平台资源使用效率,提高服务响应能力,并增强系统在突发流量下的容灾能力。该平台以 Kubernetes 为核心,结合多种云服务与开源工具,实现统一资源管理、服务标准、热点应对机制和多可用区部署,从而构建一个高效、可靠、可扩展的云原生基础设施。
主要观点
1. 降本增效与稳定性的关系
- 降本增效是企业发展的核心目标,但稳定性建设同样重要。
- 通过优化资源利用率、统一标准、动态扩缩容等手段,实现降本与稳定性的平衡。
2. 平台建设目标
- 统一资源使用标准:包括性能标准、冗余度标准、规格标准。
- 统一服务交付标准:通过 Application 对象、Deployment 模式、Runtime 标准化等方式,提高运维效率。
- 统一热点应对体系:实现从热度分析、预警、自动扩容、降级到恢复的全流程管理。
- 多可用区与双云部署:提升系统容灾能力,保障业务连续性。
关键信息
1. 资源使用标准化
- 性能标准:通过真实流量压测,统一性能衡量指标,保障 SLA。
- 冗余度标准:根据历史流量曲线和扩容速度,自动计算冗余度,确保热点期间服务可用。
- 规格标准:通过多种服务规格压测,找到资源与性能的最优组合,提升资源性价比。
2. 动态扩缩容
- 支持基于 qps/mqps 指标的自动扩缩容。
- 提供定时扩容、指标预测扩容、热点扩容等机制,实现资源的灵活调度。
- 全链路扩容时间优化至4分钟,通过混部提升资源利用率。
3. 在离线混布
- 在线服务:高优先级、延时敏感、利用率低(类比石块)。
- 离线服务:低优先级、延时不敏感、利用率高(类比沙子)。
- 实现在线与离线资源的动态调度,在线不忙时离线使用剩余资源,在线忙时抢占离线资源。
- 通过资源隔离机制(如 CPU 调度域、内存压力回收、网络带宽控制)确保资源安全。
4. 服务质量分级
- core_gc:核心在线服务,需高优先级资源。
- Ic:非核心在线服务,优先级中等。
- dlc:可被降级的在线服务,优先级较低。
- idle:可容忍短时堆积的离线服务,资源无限制。
5. 统一热点应对体系
- 建立五级热点体系,分别从热度和烈度两个维度评估服务状态。
- 支持10秒级流量预警与运营Push,实现热点快速响应。
- 热点处理机制包括自动扩容、自动降级、五级预案。
- 热点恢复包括自动缩容、恢复降级、复盘与优化。
6. 多可用区建设
- 采用 三可用区 + 双云部署(阿里云、华为云)。
- 提供统一集群管理,实现跨云资源的统一调度。
- 需要解决跨可用区服务调用、依赖服务非多可用区部署等问题。
- 通过 依赖梳理、业务改造、容灾演练等方式,提升多可用区部署的可靠性。
7. 统一标准,提高效率
- 服务描述标准化:使用 Application 对象统一描述服务配置。
- Runtime 标准化:支持 Java 等运行时,通过注解快速注入平台能力。
- 应用交付标准化:采用 GitOps + ArgoCD 实现可持续部署,降低运维复杂度。
建设成果与挑战
1. 建设成果
- 实现了资源利用率的显著提升。
- 热点应对能力增强,扩容时间缩短,服务质量提升。
- 构建了统一的 PaaS 平台,支持多种云厂商与多可用区部署。
- 通过统一标准,提升了研发运维效率。
2. 存在的挑战
- 跨可用区服务调用与依赖问题仍需进一步优化。
- 故障演练与混沌测试仍需加强,以提升系统鲁棒性。
- 稳定性建设是一个长期过程,需持续投入与迭代。
未来展望
- 智能化服务画像:通过 AI 技术实现服务的自动识别与分类。
- 智能化服务编排:基于服务画像进行自动化资源分配与调度。
- 智能化热点检测与应对:实现热点的自动发现与快速响应。
- 架构单元化:进一步拆分系统模块,提升可维护性。
- 快速重建微博:通过模块化与自动化,实现平台的快速恢复与重建。
案例启示
- 平台建设需快速验证关键技术点,并落地 MVP 版本。
- 充分利用开源社区,并积极参与社区建设。
- 在原有架构基础上进行改造与升级,减少迁移复杂度。
- 稳定性建设需长期投入与持续优化。
总结
微博云原生 PaaS 平台通过资源使用标准化、动态扩缩容、在离线混布、服务质量分级、热点应对体系、多可用区建设等多方面实践,显著提升了平台的降本增效与稳定性能力。未来,平台将向智能化、单元化、自动化方向持续演进,以更好地支撑微博的业务发展与技术创新。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载