2025-03-24-中智凯灵_北京_科技-大语言模型服务管理的实践分享_30页_12mb
报告摘要
大语言模型服务管理的实践分享总结
演讲嘉宾介绍
王夕宁是阿里云容器服务技术研发负责人,拥有丰富的Kubernetes、云原生和服务网格领域经验,持有100多项专利。他曾在IBM工作并领导多个产品项目,著有《Istio 服务网格解析与实战》,并参与多个技术大会。马元元未在内容中详述。
LLM服务管理的特征与挑战
- 流量管理挑战:LLM请求/响应体积大、处理时间长(从秒级到分钟级),难以缓存,计算资源需求高(如GPU占用100%)。
- 调度问题:由于自回归特性,执行时间不可预测;传统FCFS调度可能导致Head-of-Line阻塞。
- 安全和可观测性:缺乏AI感知的流量管理,易受过载影响;敏感信息处理需额外防护。
应对思路与方案
- 智能调度:引入SSJF(推测最短作业优先)调度器,使用Token长度预测模型优化请求处理顺序。
- 流量管理:采用令牌桶和WFQ(加权公平排队)调度器,优先处理高价值请求,控制并发量,以防过载。
- 安全防护:实施多层安全模型,包括入口网关、sidecar和出口网关的JWT验证、API密钥管理、敏感信息检测及全链路TLS保护。
- 可观测性:增强日志、监控指标和链路追踪,兼容OpenTelemetry,提供请求级别分析。
现有的技术基础之上扩展支持
- 服务网格集成:利用Kubernetes和服务网格技术,扩展AI服务管理,包括声明式用户接口(如LLMSecurityPolicy)。
- 扩展插件:添加自定义日志、监控、DLP防护、提示词预处理等组件,提升AI工作负载管理灵活性。
- 声明式API:支持Istio原生API扩展,实现LLM请求路由、外部服务访问、流量分发和安全策略配置。
MSM: Model Service Mesh
- 概念:Model Service Mesh(MSM)结合服务网格和AI服务管道,提供统一方式管理GenAI/LLM工作负载。
- 架构:数据面包括代理和AI工作负载代理;控制面支持流量调度、安全策略和可观测性增强。
- 案例分享:以ChatQnA为例,展示了MSM在流量、安全和可观测性方面的应用简化了GenAI部署和管理。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载