20250420-国金证券-大模型赋能投研之七_如何结合结构化数据搭建本地智能投研系统_-RAGFlow原理篇_36页_4mb
报告摘要
大模型赋能投研之七:如何结合结构化数据搭建本地智能投研系统?-RAGFlow 原理篇
核心内容
本文围绕RAG(Retrieval Augmented Generation)架构在金融投研场景中的应用展开,重点分析了RAG架构的意义、痛点问题及RAGFlow作为开源解决方案的实现方式与效果评估。通过结合结构化数据与非结构化数据,RAGFlow为构建高质量本地智能投研系统提供了技术路径与优化策略。
主要观点
-
RAG架构的意义
- RAG通过引入知识库,解决大语言模型存在的“幻觉”、过时信息和专业知识匮乏等问题,提升模型输出的准确性与可靠性。
- RAG以向量数据库为核心,实现从文档解析入库到检索输出的完整流程,通过增强检索辅助LLM进行逻辑推理。
-
RAG的痛点问题
- 索引入库:文本识别与分块、信息进一步处理、Embedding模型选择。
- 检索输出:内容检索、重排序模型选择、Prompt处理。
- 向量数据库:需保证高效的存储与检索能力,同时支持结构化与非结构化数据的融合。
-
RAGFlow的解决方案
- RAGFlow采用“Quality in, Quality out”理念,通过DeepDoc组件实现复杂文档解析,支持多种格式的文档与结构化数据。
- 引入Raptor召回增强策略和知识图谱策略,提高检索与生成质量。
- 提供多路召回与重排序机制,结合关键词和向量搜索,增强信息匹配能力。
- 支持结构化数据解析,如表格数据,通过“Table”模式处理,确保数据完整性与上下文关联。
-
RAGFlow效果评估
- 通过15篇金融研究报告的评估样本,对不同配置方案进行测试,最终确定较优方案:使用SFR-Embedding-Mistral和bce-reranker-base_v1模型,结合General解析方法与Raptor策略。
- 评估结果显示,RAGFlow在检索输出效果上优于Dify(默认配置)。
-
RAGFlow的金融投研应用
- 支持智能研报解读、政策法规分析、智能金融客服、多维度投资分析、智能金融顾问、宏观经济评估等场景。
- 通过结构化与非结构化数据的结合,提升信息整合与智能决策效率。
关键信息
- DeepDoc:RAGFlow自主研发的文档解析组件,支持复杂文档类型,包括手册、问答、表格、论文等,具有强大的版面分析与分块能力。
- Raptor策略:通过递归聚类与摘要生成,构建多层次的树形知识体系,提高检索质量与答案匹配度。
- 知识图谱:通过实体识别与关系构建,增强查询语义理解,提高答案的准确性与全面性。
- Embedding模型选择:根据评估结果,SFR-Embedding-Mistral在中文语境和财政金融领域表现优异。
- 重排序模型选择:bce-reranker-base_v1模型在多个任务中表现良好,提升检索结果的匹配度。
- 向量数据库:当前使用Elasticsearch,未来将接入自研的Infinity数据库,提升效率与性能。
RAGFlow系统架构
- 分为“索引入库”和“检索输出”两部分。
- 索引入库包括文档识别分块、文本向量化、知识图谱构建等。
- 检索输出包括问题向量化、多路召回、重排序、Prompt处理与LLM生成。
风险提示
- RAGFlow评估基于v0.17.2版本,未来版本可能影响效果。
- 评估样本较小,且使用DeepSeek chat模型,结果可能受模型与数据影响。
- RAG架构不能完全消除大模型“幻觉”问题,需人工审核与判断。
总结
RAGFlow作为注重质量的开源RAG解决方案,通过深度文档解析、结构化数据支持、Raptor与知识图谱策略等手段,有效解决了RAG架构中的多个痛点,提升了本地智能投研系统的准确性与效率。其优化后的配置方案在金融领域表现良好,为实际应用提供了有力支撑。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载