2023金融大模型技术创新与应用探索报告-度小满_46页_3mb
报告摘要
金融大模型技术创新与应用探索报告总结
-
金融大模型训练技术
度小满通过定向优化实现金融大模型突破,重点提升专业金融知识理解、逻辑推理、计算能力等核心金融场景能力。实现路径包括:(1)增量预训练二阶段方案:第一阶段保持中英文1:1数据配比训练40B tokens,第二阶段提升中文和金融数据比例至60%:15%,训练300B tokens。中文词表构建采用字粒度扩展方式,新增7k中文字符,压缩率提升48%。(2)指令微调采用通用与金融指令4:1配比方案,结合自研200k高质量指令数据和10M+开源数据,通过mask机制和全局损失函数优化模型响应质量。(3)强化学习对齐体系:构建语言/安全/金融三类prompt模版,设置人工标注的reward model,实现模型输出与人类价值观、行业规范的精准对齐。 -
金融大模型评测体系创新
针对传统评测方法存在的刷榜风险,构建双轨评测体系:(1)自动评测集包含7173道中文金融专项题,覆盖10大类金融考试内容,如注册会计师、证券从业资格等,并集成FinanceIQ评测框架。(2)人工评测采用14大维度+600+题的定制化体系,包含客服话术、营销文案、风险合规等专项任务。(3)建立"阶段评测"机制,通过预训练、微调、强化的全流程数据追踪,实现训练效果的实时反馈验证。 -
金融大模型应用实践创新
在具体业务场景中实现价值转化:(1)营销领域:基于用户画像生成个性化营销素材,提升转化率25%;创建一体化营销工作坊模式,将人工坐席向智能客服转型。(2)风控体系:开发智能风控决策引擎,整合NLP、知识图谱等技术,实现客户实时数据感知和策略动态优化。(3)办公场景:推出ChatMan助手,用户满足率从20%提升至86%,涵盖需求理解、文档处理、代码生成等20+功能模块。(4)客户服务:构建NL2SQL能力,实现复杂查询的自动化处理;开发多语言支持的虚拟客服系统。(5)研发提效:代码生成工具支持8种编程语言,代码采纳率超40%,提升研发效率近20%。 -
技术突破与成果
轩辕大模型系列取得显著进展:(1)轩辕-70B在C-Eval和CMMLU榜单排名首位,相较GPT4在金融考试类任务表现更优。(2)通过量化技术,推出8-bit和4-bit版本模型,降低推理显存需求(从129G降至14G)。(3)建立覆盖70%中文语料的高质量数据集,包含网页/书籍/金融资讯等多类型数据,经三轮质量校验。(4)研发效率提升方案:通过FlashAttention等算子优化,单卡训练吞吐量提升36%;采用ZeRO并行优化,显存占用降低87%。(5)构建全流程技术体系:包含数据清洗、模型训练、应用增强等模块,形成"知识-能力-场景"三位一体的进阶路径。 -
未来发展布局
持续开源大模型矩阵:5月发布轩辕-千亿模型,9月推出轩辕-70B及量化版本,11月完成金融大模型评测体系构建。计划2024年12月开放轩辕-13B模型,同步推进《大语言模型原理与工程实践》技术书籍出版,构建开放生态,推动行业技术共同进步。
试读结束,高清完整版pdf/doc/ppt,请点下载