大语言模型系统级单位token能耗测评_18页_5mb
报告摘要
大语言模型系统级单位token 能耗测评总结
核心内容
随着大语言模型(LLM)的广泛应用,其系统级单位token能耗成为影响实际部署与运行的关键因素。文档分析了当前LLM在实际业务场景中的能耗挑战与评测方法,提出了系统级单位token能耗测评的必要性,并探讨了未来在能效优化、绿色算力调度、模型与硬件匹配等方面的发展方向。
主要观点
- 能效成为竞争关键:未来竞争不仅是模型能力的竞争,更是能效与可持续性的竞争。推理成本已占机器学习计算需求的80-90%,且单位token推理电费可达1.4元,占API定价的7%-28%。
- 现有评测体系不足:传统模型榜单(如MMLU、GSMBK)仅关注模型能力,缺乏对硬件、能耗及业务场景的综合评估,无法指导实际部署。
- 场景驱动选型:不同业务场景对模型能力、上下文长度、生成长度、并发数、精度等有不同要求,需根据场景特性选择最优模型与硬件组合。
- 能效与硬件配置密切相关:合理的硬件配置(如TP与BS)能显著影响模型的吞吐、延迟与能耗表现,且存在“能效甜点”配置区间。
- 推理引擎影响能效:推理引擎(如vLLM与SGLang)对模型性能与能耗影响显著,某些情况下其影响甚至超过模型架构本身。
- 系统级能耗评估需求:需要构建涵盖模型、硬件、场景的综合评测体系,以支持更科学的选型与部署决策。
关键信息
评测目标
- 提供单位token能耗、吞吐、延迟等关键指标的系统级评估
- 为B端选型、部署与调度提供科学依据
评测方法
- 统一测试环境:使用8 x NVIDIA GPU,vLLM 0.19.1 + Zeus 0.13.1
- 标准化评测流程:包括模型下载、硬件就绪、并发请求发送、能耗与性能数据采集等
- 实测场景:包括通用文本聊天、代码补全、多模态图像问答等
核心指标
- 能耗(J/token):衡量单位token的能耗表现
- GPU利用率:反映硬件资源使用效率
- TTFT(首token延迟):评估模型响应速度
- TPOT(解码速度):衡量吞吐能力
- Throughput(系统吞吐):单位时间处理的token数量
主流模型与性能对比
| 模型 | 参数量 | 精度 | 架构 | 文本(J/token) | 代码(J/token) | 多模态(J/token) | 特征标签 |
|---|---|---|---|---|---|---|---|
| Gemma4-31B | 31B | BF16 | Dense | 0.35 | 0.47 | 0.84 | 全局最低·跨任务稳定·Dense标杆 |
| gpt-oss-120B | 120B | FP8 | MoE | 0.37 | 0.53 | — | MoE+低比特·能效吞吐均衡 |
| Llama4-Maverick | 400B | FP8 | MoE | 0.64 | 0.91 | 0.86 | 多模态最佳·无短板 |
| Qwen3.5-397B | 397B | FP8 | MoE | 1.07 | 2.18 | — | 跨任务能耗高且波动剧烈 |
| MiniMax-M2.7 | 172B | BF16 | MoE | 0.85 | 0.86 | — | 代码场景吞吐登顶 |
| DeepSeek-V4-Flash | 284B | FP4+FP8 | MoE | 0.97※ | 1.92 | — | 换SGLang(原vLLM 4.43)↑5.7×吞吐 |
| Mistral-Medium-3.5 | 128B | FP8 | Dense | 0.82 | 1.18 | 2.28 | 多模态能耗最高·视觉解码瓶颈 |
| MiMo-V2-Flash | 309B | FP8 | MoE | 0.92 | 1.43 | — | 中等表现,框架适配待完善 |
能耗与性能关系
- 批处理大小(BS) 是能效的第一驱动力,随着BS增大,能耗显著下降
- TP(并行度) 能抑制延迟,但过高TP会增加通信开销,抵消计算收益
- 能效甜点:TP=2/4,BS=64/128,能耗、延迟、利用率三者最均衡
推理引擎对能效的影响
- vLLM vs SGLang:SGLang在文本与代码场景中表现更优,能效提升显著(如文本场景下吞吐提升5.7倍,能耗降低78%)
- 推理引擎对模型性能与能耗影响显著,需考虑框架适配性
评测体系优势
| 维度 | 传统榜单 | 本评测方案 |
|---|---|---|
| 硬件实测 | 未涵盖 | 实测 |
| 能耗评测 | 未涵盖 | 核心指标 |
| B端选型 | 未涵盖 | 决策引擎 |
| 调度能力 | 无 | Aitra调度 |
场景适配建议
| 业务场景 | 推荐模型 | 推荐配置 | J/token | 理由 |
|---|---|---|---|---|
| 文本·能效极致 | Gemma4-31B | TP=2, BS=128 | 0.348 | 全场最低能耗,2卡即可部署 |
| 文本·吞吐优先 | gpt-oss-120B | TP=8, BS=128 | 0.373 | 4013 tok/s,能效吞吐均衡 |
| 代码·吞吐优先 | MiniMax-REAP | TP=8, BS=256 | 0.86 | 4180 tok/s,代码吞吐登顶 |
| 代码·能效优先 | gpt-oss-120B | TP=8, BS=128 | 0.535 | 3846 tok/s,代码场景能效最优 |
| 图像·能效优先 | Gemma4-31B | TP=2, BS=128 | 0.467 | 多模态场景能效最优 |
| 图像·吞吐优先 | Llama4-Maverick | TP=8 | — | 3365 tok/s,多模态吞吐第一 |
前瞻与未来价值
- Token级能耗精确定位:通过高精度硬件传感与侵入式测量,实现对计算任务的毫秒级能耗同步,捕捉瞬态能量特征
- 揭示通信能耗瓶颈:识别大规模并行下的通信能耗问题,为系统优化提供依据
- 捕捉长尾能耗效应:量化指令分配不均或缓存失效,指导编译器算子重排
- 支持动态电压频率调整:基于能耗特征实现亚毫秒级的电压调整,提升系统能效
局限与挑战
- 模型覆盖有限:评测仅覆盖主流模型,新兴与长尾模型未纳入
- 硬件基线单一:当前评测基于特定硬件平台,难以反映真实多样化部署环境
- 框架适配差异:不同推理框架对模型优化能力不一,影响评测公平性
- 量化精度差异:不同量化方法与精度设置影响模型性能与稳定性
- 测试负载代表性不足:测试集规模与场景覆盖有限,难以全面反映真实业务需求
未来展望
- 扩展评测维度:涵盖训练、微调与推理全生命周期
- 纳入更多硬件平台:如NPU、TPU及国产AI加速器
- 与标准与政策衔接:推动评测标准与行业政策协同,提升合规性与国际化
- 构建“测-评-用-优”闭环:实现数据驱动的持续优化与价值闭环
致谢
本次测评由清华大学电机工程与应用电子技术系信息能源实验室、清华四川能源互联网研究院信息能源与绿色智算技术研究所、新型电力系统运行与控制全国重点实验室电化学储能高效集成与控制团队联合牵头编制,Linux基金会研究部门和SODA基金会提供开放协作生态系统支持。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载