2025-03-24-中智凯灵_北京_科技-基于eBPF和Agent构建LLM训练推理优化体系_43页_12mb
报告摘要
总结
演讲者介绍
向阳是清华大学博士、云杉网络研发VP及DeepFlow开源社区负责人。曾任教于清华大学并发表可观测性相关学术论文于SIGCOMM/IMC,现任DeepFlow项目负责人,重点打造适用于云原生与AI场景的零侵扰可观测性产品。
PART 01:背景:训练和推理的效率挑战
LLM训练与推理面临的挑战:
- 训练开销大:GPT-4训练时间长达90~100天,Llama-3.1需54天,总体GPU使用率(MFU)通常在30~40%以下。
- 推理资源要求高:小模型(Llama 8B)只有1 GPU时初次响应仍可达640GB显存,MBU(FP32至INT4模型)在GPU数量与通信复杂性间需权衡。
- 显存消耗问题与GPU跨代不兼容、跨节点数据通信面临瓶颈,模型体积大与计算性能差因素交织。
PART 02:现状:传统解决方案和工具的问题
当前工具存在以下局限:
- Nsight等需重启程序,不具备CPU上下文追踪能力。
- Profiler多依赖PyTorch且有高侵入性,性能消耗严重。
- 尾部网络观察工具颗粒度粗糙,难以定位分布式应用(如K8s Pod)性能瓶颈。
PART 03:方法:eBPF 构建零侵扰可观测性
通过eBPF实现可观测性的优势:
- 无代码、无重启:通过eBPF uprobes/uretprobes等方式,监控CUDA、nccl、系统调用等;
- 深度剖析:支持GPU计算栈到CUDA函数、显存申请机制(HBM)与通信性能(RDMA卡层)的全栈追踪;
- 具体实现包括:
- HBM Profiling:追踪显存分配与使用;
- RDMA Communication Profiling:分析NCCL通信延迟、丢包、吞吐;
- 分布式追踪集成DeepFlow:包括协议自动识别、服务间端到端分析能力。
PART 04:实践:PyTorch 全栈剖析和追踪
DeepFlow集成多种eBPF技术反问题:
- 提供计算资源、显存管理、通信性能等火焰图;
- 支持跨多个GPU、节点的PyTorch作业性能分析;
- 实现零码侵入,智能提取业务、GPU与通信性能指标,加速任务优化。
PART 05:探索:Agent 自动优化 ML 代码
DeepFlow将LLM用于自动优化ML性能,提升训练与推理效率。未来模型优化方向之一是自动分析出全栈函数调用,辅助参数量或计算结构优化。
整体展示了以eBPF为核心、Agent赋能为方向的LLM训练推理可观测性与性能优化体系,DeepFlow正是实施该技术理念的具体平台。演讲提出:AI训练推理无通用银弹,仍需持续观测与优化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载