> **来源:[研报客](https://pc.yanbaoke.cn)** # MTT S5000 Prefill-as-a-Service 技术白皮书总结 ## 核心内容 本白皮书探讨了大模型推理服务在向高并发、长上下文演进过程中,Prefill(预填充)与 Decode(解码)两个阶段在计算特性和硬件资源需求上的根本差异,并提出了基于异构 PD 分离的架构演进方案。该方案通过将 Prefill 与 Decode 分别调度至不同的资源池,实现资源的按需匹配与高效利用,为推理服务提供了一种结构化的优化路径。 --- ## 主要观点 1. **大模型推理服务的演进** - 当前大模型推理服务已从短上下文、单请求模式,演进为支持 Agent、AI Coding、长文档分析等场景的长上下文在线系统。 - Prefill 阶段为计算密集型,依赖浮点算力;Decode 阶段为访存密集型,依赖显存带宽与容量。 2. **同构混部架构的局限性** - 在同构 GPU 集群中,Prefill 与 Decode 混合调度导致资源错配与尾延迟恶化。 - 长请求的 Prefill 会占用调度窗口,影响 Decode 的并发与延迟,形成“平均指标健康,P99 恶化”的矛盾。 3. **PD 分离架构的必要性** - PD 分离是推理基础设施的结构性演进,而非仅调度优化。 - 通过将 Prefill 与 Decode 分离,可实现资源利用率提升、弹性伸缩、SLO 保障与成本优化。 4. **异构 PD 分离方案的架构设计** - MTT S5000 作为 Prefill 计算池,GPU A\* 作为 Decode 生成池。 - 基于 SGLang 的 PD 分离与分页 KV Cache 机制,结合 Mooncake 框架实现跨节点传输。 - 通过页粒度直传路径,实现 Prefill 与 Decode 的解耦,消除转换与带宽开销。 5. **MTT S5000 的适配性** - MTT S5000 支持 FP8 精度,具备高密度计算能力,适配 Prefill 阶段的计算密集需求。 - 原生支持 CUDA,具备良好的生态兼容性,便于迁移与部署。 - 支持分页 KV Cache 管理,提升资源利用率与灵活性。 --- ## 关键信息 ### 1. **PD 分离的资源需求差异** - **Prefill 阶段** - 计算密集型,主导计算由线性层与注意力机制构成,随上下文长度呈平方增长。 - KV Cache 写入量与输入 token 数、模型结构相关,显存需求相对较低。 - **Decode 阶段** - 访存密集型,依赖 KV Cache 的读取带宽与容量。 - 每生成一个 token,需读取历史 K/V 数据,且不能共享权重计算资源。 ### 2. **异构 PD 分离的价值** - **资源利用率提升** - 按需匹配硬件规格,避免算力与带宽的双向浪费。 - Prefill 池与 Decode 池可分别优化,提升集群整体吞吐与稳定性。 - **弹性伸缩能力** - 基于实时负载调整资源配比,避免冗余配置。 - 针对不同业务形态(如 Agent、AI Coding)动态调整 Prefill 与 Decode 的资源供给。 - **SLO 保障能力** - 通过物理隔离与资源预留,提升 TTFT 与 ITL 的稳定性。 - 针对高优先级任务,可预分配 Decode 资源,保障用户体验。 - **成本优化能力** - 将昂贵算力集中用于 Prefill,显存带宽资源用于 Decode,避免资源浪费。 - 降低单位 Token 的基础设施成本,提升算力投资回报率。 --- ## 实测性能与收入测算 ### 1. **性能表现** - **测试模型**:GLM-5.2(FP8 精度) - **测试场景**:64K 到 400K 输入长度,P50 TTFT ≤ 6000ms - **测试结果**: - 64K 输入场景下,单机 8 卡 MTT S5000 实现 Prefill 吞吐 **95,920.5 tok/s**。 - 在混合上下文场景下,单台服务器的等效吞吐为 **83,670.6 tok/s**,TPM 达 **5 MTokens/min**。 ### 2. **收入测算** - **定价基准**:智谱官网 API 价格(2026年8月20日) - 输入 Token 单价:8 元/百万 Tokens - 缓存命中 Token 单价:2 元/百万 Tokens - **收入公式**: $$ R_m = 2.592 \times T \times [(1 - r) \cdot p_m + r \cdot p_h] $$ - 其中 T 为 Token 吞吐率,r 为缓存命中率。 - **典型 Agent 业务场景下的收入**: - 单台满载月收入约 **56.4 万元**。 - 在 40% 利用率下,单台月收入仍可达 **22.6 万元**。 --- ## 技术实现与部署方案 ### 1. **网络架构** - **计算平面**:400G RoCE 网络,保障 Prefill 与 Decode 之间的高速传输。 - **业务平面**:25G 网络,承载外部访问与服务调度。 - **带外管理平面**:千兆网络,专用于运维操作。 ### 2. **部署实例** - 1 台 128 口 400G RoCE 交换机 - 1 台 25G 业务交换机 - 1 台 千兆带外管理交换机 - 2 台 MTT S5000(Prefill) - 4 台 GPU A\*(Decode) ### 3. **传输机制** - 通过 Mooncake Transfer Engine 实现 KV Cache 跨节点传输。 - 利用 GPUDirect RDMA 技术,减少数据拷贝与延迟。 - 页粒度直传路径实现零转换开销,前提是 KV Cache 格式、精度、页大小与布局完全一致。 --- ## 结论 - **PD 分离是推理服务的结构性演进**,而非简单的调度优化。 - **MTT S5000** 是构建 Prefill as a Service 算力池的理想选择,其高密度 FP8 算力、原生精度支持与 CUDA 兼容性,使 Prefill 阶段具备高吞吐与低延迟。 - **异构 PD 分离方案** 为长上下文推理提供了一条可规模化落地的成本优化路径,使资源供给、调度策略与服务目标按阶段解耦,提升整体系统效率与用户体验。 - **经济模型** 表明,该方案具备可预测的收入能力,单位算力收入优势显著,是推理服务运营商实现长期收益的关键。 --- ## 参考文献 - [1] QIN R, HE W, WANG Y, et al. Prefill-as-a-Service: KVCache of Next-Generation Models Could Go Cross-Datacenter. - [2] University of Michigan, Stanford University, et al. How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks. 2026.