大语言模型服务管理的实践分享_30页_12mb
报告摘要
2024 AI+研发数字峰会总结
核心内容
本次2024 AI+研发数字峰会聚焦于大语言模型(LLM)服务管理的实践与解决方案,由阿里云的王夕宁和马元元分享。会议内容围绕LLM服务管理的特征、挑战、应对方案以及Model Service Mesh(MSM)技术展开,旨在通过优化LLM服务管理,提升企业研发效率和成本效益。
主要观点
LLM服务管理的特征与挑战
- 流量特征不同:与传统网络流量相比,LLM服务流量具有更大的请求/响应大小、较长的执行时间、不可预测的执行时间以及无法缓存的内容。
- 执行时间不可预测:由于LLM的自回归特性,推理请求的执行时间可能从几秒到几分钟不等,导致调度复杂性增加。
- 调度问题:传统FCFS调度策略容易造成“行首阻塞”问题,影响服务效率。
应对思路与方案
- SSJF调度器:通过训练一个代理模型预测输出Token长度,从而实现推测最短作业优先(SSJF)调度,优化资源分配。
- 智能工作负载优先级调度:根据业务价值和请求紧急程度调整资源分配,实现优雅降级。
- 并发速率限制策略:通过细粒度标签识别用户,控制请求并发量,防止服务过载。
- 负载坡道策略:通过闭环反馈逐步增加系统负荷,确保系统稳定性。
- 配额调度策略:使用全局令牌桶和智能排队,实现请求的优先级调度,避免直接拒绝请求。
- 流量缓存策略:通过缓存高成本操作,减少重复请求,提升性能并降低成本。
基础设施级别的LLM请求路由支持
- 动态配置与灵活切换:支持根据用户身份动态调整后端模型,实现应用无感的切换。
- 多Provider流量分发:按比例在多个Provider之间分发流量,提升系统灵活性和可用性。
安全防护
- 多模型安全策略:包括基于入口网关、sidecar和出口网关的安全模型,实现能力全面、责任分离的安全防护。
- API_KEY管理:支持无损的API_KEY轮转,防止API_KEY泄露。
- 敏感信息校验:使用私有小模型动态检测请求中的敏感信息。
- 全链路TLS/mTLS:确保通信安全。
- JWT身份校验与授权策略:支持外部鉴权,增强系统安全性。
可观测性
- Log、Metrics、Trace:支持Log、Metrics和Trace功能,兼容OpenTelemetry标准。
- 自定义访问日志字段:支持查看请求级别的Token消耗情况和使用的模型。
- 监控指标增强:新增Prompt_tokens和Completion_tokens等指标,提升监控维度。
Model Service Mesh (MSM)
- MSM定义:Model Service Mesh是Service Mesh与Model Service Pipeline的结合,用于统一管理GenAI/LLM的工作负载。
- 数据面架构:包括服务网格数据面和服务编排数据面,分别负责流量管理和模型服务编排。
- 案例分享:以ChatQnA为例,展示了如何通过MSM简化GenAI服务管理。
关键信息
- LLM服务管理:具有独特的流量特征和调度挑战,需要专门的解决方案。
- SSJF调度器:通过Token长度预测实现更高效的资源调度。
- 智能工作负载管理:包括并发速率限制、负载坡道、配额调度等策略,确保服务稳定性和资源利用率。
- 流量缓存:有效减少重复请求,降低成本并提升性能。
- LLM请求路由:支持动态模型切换和多Provider流量分发,提升系统灵活性。
- 安全防护:采用多模型安全策略,涵盖API_KEY管理、敏感信息检测、身份校验和授权策略。
- 可观测性:兼容OpenTelemetry标准,提供详细的日志、指标和追踪能力。
- Model Service Mesh (MSM):作为统一管理LLM工作负载的方式,结合服务网格和模型服务编排,提升服务管理和运维效率。
总结
本次峰会深入探讨了LLM服务管理的复杂性与挑战,提出了多种创新解决方案,包括SSJF调度器、智能工作负载优先级调度、流量缓存策略等。同时,介绍了阿里云在LLM请求路由、安全防护和可观测性方面的实践,展示了Model Service Mesh (MSM)作为统一管理LLM工作负载的高效方式。这些方案和技术不仅提升了LLM服务的性能和稳定性,也为企业的研发和运维提供了新的思路和工具。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载