20250320-中智凯灵_北京_科技-文档解析技术加速大模型训练与应用_43页_11mb
报告摘要
2024 AI+研发数字峰会总结
核心内容
本次2024 AI+研发数字峰会聚焦于AI驱动研发变革,旨在促进企业降本增效。峰会在北京举行,时间为08/16-17。重点讨论了文档解析技术在大模型训练与应用中的作用。
主要观点
当前大模型训练与应用中的挑战
- 训练Token耗尽:大模型训练需要大量的高质量数据,而现有数据源难以满足需求。
- 训练语料质量要求高:需要更多高质量数据以提升模型性能。
- 文档解析不精准:在LLM RAG应用中,文档解析的准确性直接影响输出质量。
- 文档格式多样:包括PDF、扫描件、书籍、论文等,解析难度较高。
高质量预训练数据的需求
- 需要更多高质量数据,以支持大模型的训练与优化。
- 互联网上的数据源包括CommonCrawl、C4、Github、Wikipedia、StackExchange和Huggingface等。
文档解析技术的重要性
- 文档解析技术是实现大模型在非结构化数据中有效应用的关键。
- 文档解析技术需处理多种文档类型,包括有标记文档和无标记文档。
- 有标记文档(如Word、Markdown、HTML)具有结构信息,易于处理。
- 无标记文档(如PDF、扫描件)缺乏结构信息,解析难度大。
关键信息
文档解析技术
- 文档解析技术旨在将非结构化文档转化为结构化数据。
- 解析目标包括文档元素识别、表格、段落、公式、标题等。
- 转化速度快,支持上百页PDF文档的解析。
- 版面正确解析,支持双栏、三栏、文表混合等复杂布局。
- 阅读顺序还原,避免混乱语序,提升文档解析的可用性。
文档解析技术的应用
- 文档问答和知识库问答:基于文档解析技术,大模型能够更精准地提取信息,提高问答准确率。
- TextIn文档解析技术:提供更稳、更准、更快的解析服务。
- 文档图像预处理:处理电子档和扫描件,提升解析效果。
- 版面分析:包括物理版面分析和逻辑版面分析,前者关注视觉特征,后者关注语义特征。
- 文字识别:支持多方向文字检测和多语言识别。
- 表格识别:通过判断表格类型、检测单元格角点、线段等实现表格结构分析。
- 公式识别:识别并解析数学公式,支持LaTeX格式。
文档解析技术的开源库
- 基于规则的开源库:如pyPDF2、pdfminer等。
- 基于深度学习/大模型的开源库:如Unstructured、Layout-parser、PP-StructureV2、PDF-Extract-Kit、pix2text等。
文档解析技术的性能
- TextIn文档解析技术在多个指标上表现优异,包括:
- 单页耗时:通常300ms~900ms
- 多页耗时:100页,P90 < 2s(1.5s)
- 文件错误率:约20份/万份
- 页面丢失率:约5页/万页
文档解析效果测试
- 测试集:年报全元素测试-单页-432张
- TextIn表现:
- 平均表格文本全对率:0.638
- 平均表格树状编辑距离:0.942
- 平均表格结构树状编辑距离:0.959
- 平均段落识别率:0.79
- 段落召回率:0.754
- 其他产品表现:
- 平均表格文本全对率:0.294, 0.628
- 平均表格树状编辑距离:0.688, 0.891
- 平均表格结构树状编辑距离:0.734, 0.953
- 平均段落识别率:0.441, 0.785
技术成果
- YOLO算法:用于文档解析的物体检测,具有极高的速度和效率。
- 文档树引擎:通过Transformer架构,预测旁系类型与父子类型,构建文档树结构。
- 文档解析效果测试基准:从段落、标题、表格和公式四个维度进行评估,提供详细的指标说明。
文档解析技术的未来展望
- 真实世界中更丰富布局类型的版面分析:支持更多复杂版式。
- 文档解析技术的工程性能:持续优化,以满足实际应用场景的需求。
- 文档解析技术的综合应用:结合大模型,提升文档问答的精度和效率。
总结
- 文档解析技术是AI驱动研发的重要组成部分。
- TextIn文档解析技术在多个指标上表现出色,提供更高效、更准确的文档解析服务。
- 大模型在文档解析中的应用,提升了文档信息的提取和利用效率。
- 未来方向包括更复杂的版式识别、更高的解析精度和更快的处理速度,以满足更多行业和应用场景的需求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载