网络AI服务质量_指标和测试体系_白皮书_(2026_年)_31页_1mb
报告摘要
网络 AI 服务质量指标和测试体系白皮书总结
核心内容概述
本白皮书由 中国移动通信研究院、罗德与施瓦茨(中国)、唯亚威通讯、中关村泛联移动通信技术创新应用研究院、浙江大学 联合发布,旨在构建适用于 6G 网络 AI 服务的 服务质量指标体系(QoAIS) 与 测试床体系,以应对 AI 服务在 6G 网络中的新兴特性与质量保障需求。
主要观点
- 5G 网络服务质量体系(QoS)无法满足 AI 服务的动态流量特征和全链路质量保障需求,亟需构建全新的 AI 服务质量指标体系。
- 网络 AI 业务具有 Token 流式传输、全链路推理、多模态并发、泛在接入 等典型特征,用户体验不再仅由传统 QoS 指标(如带宽、时延、丢包)决定。
- QoAIS 指标体系采用 系统、任务、资源三层架构,从全网服务供给、单用户任务体验、资源要素性能等维度进行服务质量评估。
- 测试床系统支持 端边网云协同架构,可模拟真实无线环境,完成 AI 服务的全链路质量验证与优化分析。
- 未来将扩展测试场景与指标维度,完善 QoAIS 体系,推动网络与 AI 技术的协同发展。
关键信息
QoAIS 指标体系设计
1. 三层架构
- 系统级:衡量网络整体 AI 服务能力,包括 AI 服务密度、AI 服务系统能效。
- 任务级:关注用户侧 AI 任务体验,包括 AI 任务时延、首 Token 时延(TTFT)、Token 间隔时延、AI 任务准确度、AI 任务能效。
- 资源级:覆盖 数据、连接、计算、模型 四大要素,定义如下指标:
- 数据类:数据完整度、数据冗余度、数据时效性。
- 连接类:带宽、抖动、包时延预算、误码率、通信能效。
- 计算类:每秒浮点运算次数、计算精度、计算时延、计算能效。
- 模型类:模型准确率、模型复杂度、模型泛化性能。
2. 测试床架构
- 测试床由 终端、网络仿真、AI 服务器、数据解析 四个模块组成,支持:
- 端侧推理、边缘推理、云端推理三种部署形态。
- 多用户并发测试、资源隔离测试、端到端综合测试等场景。
- 采用 高精度功耗采集、数据质量解析、模型性能监测 三类专项方法,保障测试数据的准确性与可追溯性。
典型测试用例与结果
1. 偏差无线环境下不同部署方案性能测试
- 测试对象:Qwen2-0.5B 模型部署在终端、边缘、云端。
- 测试条件:叠加 TCL300 衰落信道。
- 实测结果:
- 终端部署:平均 TTFT = 1.53s
- 边缘部署:平均 TTFT = 2.77s
- 云端部署:平均 TTFT = 3.88s
- 结论:终端部署可有效降低首 Token 时延,提升实时交互能力。
2. 信道波动对 LLM 交互体验测试
- 测试对象:LLM 部署在边缘服务器。
- 测试条件:叠加 100ms 时延 + 100ms 抖动。
- 实测结果:
- 正常网络 TTFT 平均 3.88s
- 损伤网络 TTFT 平均 7.85s(时延翻倍)
- 结论:无线信道波动对 Token 流式传输影响显著,需强化网络资源调度与优化。
3. 不同 LLM 模型规格性能测试
- 测试对象:Qwen-Plus(通用复杂模型)与 Qwen-Flash(轻量化加速模型)。
- 测试条件:统一部署在云端。
- 实测结果:
- Qwen-Plus 平均 TTFT = 2.84s
- Qwen-Flash 平均 TTFT = 1.01s
- 结论:模型参数量与复杂度提升,首 Token 时延增加,但用户核心体验增益有限,需按需选型。
4. 对话上下文对 LLM 性能影响测试
- 测试对象:LLM 部署在云端。
- 测试条件:测试单轮提问与两轮追问场景。
- 实测结果:
- 单轮 P95 TTFT = 159ms
- 两轮 P95 TTFT = 234ms
- 结论:上下文长度增加显著影响首 Token 时延,需优化模型与网络协同策略。
5. 多用户并发 LLM 系统承载性能测试
- 测试对象:LLM 部署在云端。
- 测试条件:并发用户数从 10 户提升至 50 户。
- 实测结果:
- TTFT 从 41ms 增长至 251ms
- TTLT 从 901ms 增至 5474ms
- 结论:并发压力显著影响系统性能,需引入负载均衡、任务调度机制,缓解资源争抢。
未来展望
- 扩充测试场景与用例,覆盖 多模态 AI、AI Agent 协同 等新兴场景。
- 完善 QoAIS 三层指标体系的 全量验证,提升指标有效性与可执行性。
- 推动测试体系 自动化与标准化,形成可复用的网络 AI 测试规范。
- 促进 网络、计算、AI 协同优化,助力 6G 网络 AI 技术与业务协同发展,推动智能服务规模化商用。
附录
-
缩略语:
- 5QI: 5G QoS Identifier
- AI: Artificial Intelligence
- AIGC: Artificial Intelligence Generated Content
- LLM: Large Language Model
- TTFT: Time To First Token
- TTLT: Time To Last Token
- QoAIS: Quality of AI Service
- SCS: Subcarrier Spacing
- PDU: Protocol Data Unit
- PSNR: Peak Signal-to-Noise Ratio
- SGCS: Square Generalized Cosine Similarity
- SLA: Service Level Agreement
- To B: To Business
- To C: To Consumer
- TDL: Tapped Delay Line
- CDL: Clustered Delay Line
- HST: High-Speed Train
-
参考文献:
- CCSA WG6. 新一代移动通信系统的智能服务质量评估和保障方法研究报告(征求意见稿)[R]. 2025-12.
- 刘光毅,陈天骄,崔莹萍,等.面向AI服务质量保障的6G无线网络智慧内生架构[J].移动通信,2025,49(01):2-8.
- Rohde & Schwarz. CMX500 Radio Communication Tester Features and Functions (Version 25)[R]. 2025.
- Rohde & Schwarz. CMX500 Signaling Application User Manual (Version 25)[R]. 2025.
- GUPTA A, DIZDAR O, CHEN Y, et al. AI for air interface life-cycle management: end-to-end verification, adaptation, and procedures [J]. IEEE Wireless Communications, 2026-02.
- VIAVI Solutions. 6G Forward, Research to Reality: Advancing 6G Studies by VIAVI Marconi Labs [R]. Sept. 2025. Available: https://www.viavisolutions.com/en-us/solutions/6g-forward
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载