2024面向生产服务的大模型评估体系探讨报告-中国移动研究院_28页_6mb
报告摘要
中国移动大模型布局及评估体系分析总结
一、大模型布局及进展
中国移动自主构建了语言、视觉、语音等多种类型的基础大模型,具备跨行业供给侧增强、高可控性、异构软硬件灵活部署三大技术特色。模型参数规模覆盖9B至200B+,在71%的中文测试集主流指标上表现优于同类模型。通过联合通信、能源、航空等行业的骨干企业共建九天·众擎基座大模型,加速国民经济主体行业的智能化升级,推动战略性新兴产业发展。同时,构建网络AI大模型(JT-Net),实现从“网络+AI”向“AI+网络”转型,降低AI赋能网络的边际成本,提升资源效率与运维智能化水平。
二、大模型评估体系
面向生产服务需求,中国移动建立“多层次-多维度-多任务-多指标-多模式”的大模型评估体系。体系包括五大评测基准:语言大模型、行业大模型、多模态大模型、智能体应用、安全评测。评测数据集覆盖2000+簇,涵盖开源数据(如CMMU、CEVAL、MMLU等)及自建行业数据(如安全类数据3万+条、央企特色数据2万+条)。评测指标分为五大类:准确性(功能、客观事实)、鲁棒性(稳定性)、安全性(内容、隐私、业务)、公平性、高效性(响应时延、并发度)。评估方法结合自动评测与人工审核,支持动态反馈机制,确保模型安全、优质、高效,并推动大模型产业规范化发展。
三、九天客服大模型应用实践
九天客服大模型基于中国移动10086十亿级用户数据构建,聚焦企业级智能客服场景,具备高可控性、强系统集成、拟人化交互等特点。该模型通过意图识别、情感关怀、知识采编等功能,提升客服效率与用户体验。在技术评估中,重点关注意图理解、任务响应时间、对话状态判断、信息抽取等指标,并引入安全管控工具,如敏感词库过滤、自定义规则校验,确保回复内容可信安全。在实际应用中,该模型已在黑龙江等地的数字政府项目、政务智能客服、智能搜索等场景落地验证,支持实时转述、多轮对话、自动数据填充等功能,形成“客户-大模型-客服”三方协同交互模式。
评估体系通过分层架构设计,实现模型一键注册、快速评测与智能分析,覆盖基础评测、专项评测、领域评测、体验评测四大维度,涉及学术任务、事实知识、逻辑推理、安全等600+场景。同时,注重模型安全性和适应性,建立动态质量控制机制,确保评测结果可复现、可解释。
综上,中国移动通过构建多类型大模型、建立系统化评估体系及推动行业应用落地,全面布局人工智能技术,助力实现“AI+网络”深度融合发展目标。
试读结束,高清完整版pdf/doc/ppt,请点下载