4-教育领域大模型解决方案及评测实践-0724-文皓_36页_6mb
报告摘要
MTSC2024 中国互联网测试开发大会总结
核心内容
MTSC2024 中国互联网测试开发大会聚焦于教育领域大模型的评测体系构建与实践,强调了从通用大模型评测到教育领域专用评测的必要性与重要性。大会由 TesterHome 主办,于 2024 年 7 月 20 日在上海喜来登由由大酒店举行。
主要观点
- 大模型评测体系:当前大模型评测体系已从“百模大战”转向“产品应用”,强调实际应用场景下的评测。
- 教育评测体系:教育场景任务类型多样,评测需围绕认知全面设计,同时需考虑价值观、安全性和教学引导性等特殊要求。
- 评测框架:教育大模型评测体系包括基础能力、学科答题、教学场景功能和安全四大板块,构建了较为全面的评测框架。
- 测试方法:引入了人工评分(MOS)和客观指标,如纠错正确率、召回率、过改率等,以综合评估模型性能。
- 测试流程:强调人机结合测试流程,提升测试效率,同时确保评测结果的准确性和代表性。
关键信息
教育领域大模型评测体系
- 建设原因:教育场景任务类型多,需更细致的评测框架。
- 评测内容:包括基础能力、学科答题、教学场景功能、安全四大方面。
- 评测标准:参照《中高考作文评分标准》,由专业学科老师进行评分。
- 评分方式:包括主观评分和客观评分,使用加权求和方式综合评估。
教育大模型评测实践
- 测试集构建:基于智学网用户作文数据,进行页面维度分析,构建符合线上使用场景的测试集。
- 测试效率提升:通过人机结合测试,整体测试效率提升约 50%。
- 测试指标:包括纠错正确率、召回率、过改率、语言流畅度、写作要求覆盖度等。
- 测试流程:包括数据采集、模型训练、人工监督微调、模型测试、模型发布、端测、版本发布、badcase分析等步骤。
教育大模型安全评测
- 安全类型:包括内容安全、抗指令攻击、教育特性。
- 安全判定维度:涵盖社会主义核心价值观、知识产权、个人信息、内容安全、抗指令攻击、学生心理、学生行为、教育管理等方面。
- 安全措施:防止生成违法不良信息、侵犯他人利益、鼓励不当行为等。
教育大模型测试方案
- 测试维度:包括功能、效果、一致性、安全、性能稳定性、兼容性等。
- 测试方法:包括功能测试、接口测试、端到端测试、效果测试、prompt测试、RAG测试、AGENT测试、SFT测试等。
- 测试流程:从模型发布到测试、优化、发布,形成闭环。
教育大模型未来规划
- 扩展AI场景覆盖度:随着业务发展,不断扩展多场景的支持。
- 提升测试效率与准确性:通过技术视角向用户视角转变,制定效果准入条件,建设效果度量方案。
- 数据驱动模型更新:通过运营平台标签化线上数据,与数据标注平台打通,实现数据驱动的模型更新、测试和上线。
未来思路
- 模型发布后快速测试:确保模型发布后能迅速进行测试,提升迭代速度。
- 线下测试与线上情况对齐:通过标签化和人工标注,使线下测试结果更贴近线上真实情况。
- A/B测试与闭环反馈:借助大模型评测能力,进行A/B测试,快速感知模型效果变化,并通过badcase反馈与分析实现闭环。
总结
MTSC2024 中国互联网测试开发大会深入探讨了教育大模型评测体系的建设与实践,强调了从通用评测到教育专用评测的必要性。通过构建全面的评测框架、引入人机结合测试方法、制定安全评测标准和优化测试流程,教育大模型在质量评估和实际应用中取得了显著进展。未来,随着AI场景的扩展和测试效率的提升,教育大模型将在更多领域发挥重要作用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载