20250320-中智凯灵_北京_科技-大语言模型服务管理的实践分享_30页_12mb
报告摘要
2024 AI+研发数字峰会总结
核心内容
本次2024 AI+研发数字峰会聚焦于大语言模型(LLM)服务管理的实践与挑战,重点探讨了如何通过智能调度策略和统一管理方式提升LLM服务的效率与安全性。
主要观点
1. LLM服务管理的特征与挑战
-
传统网络流量管理与GenAI/LLM流量管理存在显著差异。
- 请求/响应大小较小 vs. 多模态流量导致请求/响应较大
- 请求可并行处理 vs. 单个LLM查询常占用100%的TPU/GPU资源
- 请求立即处理 vs. 需等待可用资源
- 处理时间以毫秒计算 vs. 处理时间从几秒到几分钟不等
- 相似请求可缓存 vs. 每次请求生成唯一内容
- 请求成本由后端管理 vs. 根据请求路由到不同成本的模型
-
LLM推理请求的执行时间不可预测,因此传统的先进先出(FCFS)调度方式面临行首阻塞(head-of-line)问题。
2. 应对思路与方案
- SSJF调度器:基于历史数据和模型特性训练代理模型,预测每个推理请求的序列长度,以推测最短作业优先(SSJF)调度策略。
- 智能工作负载优先级调度:根据业务价值和请求紧急程度调整资源分配,实现应用程序的优雅降级。
- 并发速率限制策略:通过细粒度标签识别用户,控制请求速率,防止服务过载和级联故障。
- 负载坡道策略:基于闭环反馈逐步增加系统负荷,确保系统在负载增加过程中稳定运行。
- 配额调度策略:使用全局令牌桶和智能请求排队,根据重要性安排请求,而非直接拒绝。
- 流量缓存策略:缓存成本高昂的操作,减少对按使用付费服务的重复请求,提升性能并降低成本。
3. 流量调度管理套件
- 统一的流量请求调度器和策略资源定义及控制器,实现灵活的流量管理。
- 支持动态配置和灵活切换后端模型,根据用户身份调整模型。
4. LLM请求路由
- 基础设施级别的LLM请求路由支持,实现应用无感、动态配置、灵活切换。
- 支持按比例分发流量到多个Provider,通过配置实现流量的自动分配与管理。
5. LLM请求安全防护
- 全链路、多角度的安全防护,涵盖入口网关、sidecar、出口网关等模型。
- 多种安全能力,包括API_KEY轮换、敏感信息检测、全链路TLS/mTLS、JWT身份校验、授权策略和外部鉴权。
6. 可观测性
- Log、Metrics、Trace,兼容OpenTelemetry标准,提供详细的监控指标与访问日志。
- 新增指标包括Prompt tokens和Completion tokens。
- 访问日志增强支持查看请求级别的token消耗情况和请求模型。
关键信息
- Model Service Mesh (MSM) 是一种统一的管理方式,结合了服务网格与模型服务流水线。
- 服务网格数据面负责流量调度与安全策略执行。
- 服务编排数据面用于管理模型服务流水线。
- ChatQnA作为简化版GenAI示例,展示了MSM在实际应用中的效果。
技术实现
- SSJF调度器通过代理模型预测序列长度,优化请求调度。
- LLMProvider配置支持API_KEY轮转,防止泄漏,提升安全性。
- 入口网关、sidecar、出口网关作为策略执行点,分别适用于不同场景的安全防护需求。
结论
本次峰会提供了丰富的实践经验和解决方案,涵盖了LLM服务管理的多个方面,包括调度策略、流量路由、安全防护和可观测性。通过Model Service Mesh,企业可以更高效地管理GenAI/LLM工作负载,实现降本增效的目标。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载