2025-03-25-中智凯灵_北京_科技-大语言模型时代需求自动追踪技术_44页_14mb
报告摘要
大语言模型时代需求自动追踪技术
主讲人
匡宏宇
- CCF软件工程专委会执行委员
- 南京大学软件学院助理研究员
- 持续十余年研究软件可追踪性、代码库挖掘、程序理解等
目录
- 需求自动追踪技术背景与发展
- LLM时代需求追踪的重要价值
- 基于LLM的需求追踪技术初探
- 个人研究简介
- 总结与展望
1. 需求自动追踪技术背景与发展
问题溯源
- 开发者视角:“新人无法快速融入团队”、“缺乏系统功能理解”
- 管理者视角:“项目资产老化”、“代码维护困难”
需求可追踪性定义
- 显式标识软件制品(需求、设计、代码、测试等)之间的语义关联
- 支持需求-代码追溯、缺陷定位、系统安全等研究
发展历程
- 1994年:Gotel首次定义需求可追踪性
- 1991年:爱国者导弹失败事件推动可追踪性成为软件开发规范
- CMMI 3级:要求实现可追踪性
技术演进
- 初始:人工实现(代价高)
- 自动化:信息检索、机器学习、深度学习
- LLM时代:通过大模型实现语义理解与匹配
2. LLM时代需求追踪的重要价值
核心价值
- 开发效率提升:需求-代码关联帮助新人快速定位代码
- 数据资产化:为LLM提供高质量数据支持软件开发
- 大模型应用前提:构建专用大模型需依赖精细化开发数据
典型场景
- 蓝色支付软件“瘦身”
- IoT公司OS社区封闭问题
- 功能定位与系统重构
3. 基于LLM的需求追踪技术初探
核心问题:概念指派
- 抽象需求与代码逻辑间存在语义鸿沟
- 需要通过大模型弥合二者差异
技术演进趋势
- 检索式方法:依赖文本关联
- 机器学习方法:标签稀疏问题未解
- 深度学习方法:BM25、BERT、LLaMA等广泛应用
- LLM应用:CLUSTER’、TAROT、TRIAD等增强策略
LLM特点
- 优势:多轮交互、语义理解
- 挑战:幻觉、结果不确定性
4. 个人研究简介
主要方向
- 需求自动追踪
- 代码库挖掘、功能关联
- 软件开发数据资产化
研究亮点
- 跨语言需求追踪:中英混合文本增强策略(AVIATE)
- 代码依赖分析:CLUSTER’(EMSE 2022)
- 检索式方法增强:TAROT(ASE 2022)、TRIAD(ICSE 2024)
- BERT提示学习:基于自学习的Issue-Commit分类(FSE 2022)
5. 总结与展望
核心观点
- 需求可追踪性是大模型时代软件开发的核心基础设施
- LLM需与传统技术结合(RAG、Prompt优化)
- 开发数据资产化是BizDevOps的关键
未来方向
- LLM微调专用模型
- 结构化输出与交互界面
- 领域知识嵌入与奖励模型
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载