AI_Checklist_QUNAR测试域结合AIGC提效实践_33页_6mb
报告摘要
2024 AI+研发数字峰会总结
核心内容
本次峰会围绕“AI驱动研发变革,促进企业降本增效”的主题,重点分享了去哪儿旅行在AI+测试域提效方面的实践与成果。通过结合AI生成技术与测试流程,显著提升了需求文档处理效率、测试用例生成质量及整体研发效率。
主要观点
- 需求沟通效率低:PM、DEV、QA三方沟通平均耗时30分钟至1小时。
- 自测自发不写 case:开发自测自发比例高达86%,导致测试用例缺失。
- 写 checklist 耗时高:5pd以下需求平均耗时1-2小时,5pd以上需求3-5小时。
- 需求文档质量参差不齐:影响AI生成的准确率和效果,缺乏统一格式和标准。
关键信息
项目背景
- 全流程结合AIGC提效:旨在通过AI技术优化测试域的各个环节。
- 需求文档预处理:提取需求正文,拆分需求点,提升AI生成的准确率。
- 触发方式多样化:包括项目管理流程入口触发、checklist平台手动触发、定时扫描生成checklist。
设计思路和方案
- 一键生成方式:基于通用大模型,聚焦于需求点,集成项目研发流程,实现高效生成。
- 智能体多轮问答:作为辅助方式,提供更灵活的交互体验。
- 用户交互层:通过TARS自动化、checklist平台等实现无缝集成。
- 系统功能层:包括需求文档预处理、需求点拆分、Prompt生成、checklist生成、思维导图转换、case转换、效果评估等模块。
基础组件
- 外部大模型:如GPT-4-turbo、GPT-3.5、chatGLM3-6B等,用于生成和评估。
- 内部大模型:使用小参数开源模型,适合私密数据处理。
- 微调策略:受限于显卡资源和缺乏标准数据集,微调效果有限。
效果评估方案
- 覆盖率:统计使用AI Checklist的项目数与总项目数的比率。
- 召回率:自动生成节点数与终版checklist节点数的比率,考虑部分采纳节点。
- 采纳率:用户采纳自动生成节点的概率,考虑部分采纳节点。
- 评估方法:包括用户点击反馈、字符串匹配、基于Embedding模型的语义相似度匹配。
效果评估模块
- Embedding模型:用于语义相似度匹配,提升评估准确性。
- 相似度阈值:98%为完全可采纳,90%为部分可采纳。
- 评估指标:采纳率与召回率的计算方式。
成果及未来计划
落地成果
- 使用范围广:每月500+个项目使用AI Checklist。
- 产品需求覆盖率:60%-70%。
- 准确率:60%-70%。
- 提效成果:
- 5pd及以下需求,每个需求节省0.1pd。
- 5pd以上需求,每个需求节省0.2pd。
- 年化可节省约200pd。
- 填补自测自发不写checklist的缺口。
未来计划
- 内部大模型微调:提升对核心私密数据的处理能力。
- 接入内部知识库:
- 业务知识库:包含公司内部概念、黑话、历史资料等。
- 技术知识库:包括系统调用关系、业务代码资料等。
- 结合多模态:支持解析PRD中的流程图、UI图等非文本信息,提升需求理解能力。
总结
通过AI Checklist的实践,去哪儿旅行实现了需求文档处理效率的显著提升,减少了QA工作量,提高了测试用例的覆盖率和质量。未来将继续优化内部大模型、接入知识库,并结合多模态信息,进一步推动AI在研发流程中的深度应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载