2025-03-24-中智凯灵_北京_科技-文档解析技术加速大模型训练与应用_43页_11mb
报告摘要
演讲者介绍
演讲者常扬是合合信息智能创新事业部研发总监,同时也是复旦大学博士,具备丰富的AI技术经验和行业洞察力。
当前大模型训练与应用中的挑战
- 训练挑战:大模型训练面临Token耗尽和语料质量要求高的问题,需要更多高质量数据。现有数据源如CommonCrawl、Wikipedia等满足但不够,需高效获取多样化数据。
- 应用挑战:在RAG(检索增强生成)技术中,文档解析不精准导致无法正确从源文件提取内容,损失非结构化数据的价值。需开发多版式、高精度、高性能的文档解析技术。
文档解析技术发展与研究内容
- 文档类型:包括有标记文档(如Word、Markdown)和无标记文档(如PDF扫描件),前者机器可直接读取,后者需解析。
- 技术演进:从光学模板匹配开始,到统计模式识别、深度学习主导,近年由大模型推动,解决复杂版式问题。
- 关键问题:涉及图像处理、版面分析、内容识别等,挑战包括多栏处理、元素识别、版面逻辑结构。
- Current Status:最新研究关注真实世界布局,如复杂的表格、公式识别。
TextIn文档解析技术算法框架
- 算法Pipeline:整合物理版面分析(视觉特征聚合和布局检测)与逻辑版面分析(语义层次构建,使用Transformer预测关系),支持PDF、Markdown等格式。
- 性能:单页耗时300-900ms,多页100页P90<2s,低错误率约20/万份文件,高精度在表格、段落、标题识别上领先。
- 效果:通过开源测试基准显示优势,提升文档转结构化数据的准确性与速度。
基于文档解析技术的大模型应用探索
- 开放域多模态信息抽取:从非结构化文档中自动提取关键信息,如字段抽取和列表抽取,提高信息处理效率。
- 分析师问答产品:使用RAG技术,精准检索知识库内容,支持多文档对比,置于金融文档等场景,提升投研效率。
- 应用演示:展示TextIn解析技术在问答精度和信息提取上的提升。
总结与展望
演讲强调TextIn文档解析技术通过高精度、高性能算法,加速大模型训练和应用,提供全面工具矩阵,展望未来在更多领域的技术演进与整合。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载