20250320-中智凯灵_北京_科技-多模态文档大模型mPLUG-DocOwl_57页_12mb
报告摘要
2024 AI+研发数字峰会总结
核心内容
2024 AI+研发数字峰会在北京举行,聚焦于AI在研发领域的应用与变革,旨在促进企业降本增效。会议重点介绍了阿里巴巴通义实验室在多模态文档大模型领域的研究成果,特别是mPLUG-DocOwl模型。
主要观点
多模态文档大模型背景
- 文档图片理解的重要性:随着AI技术的发展,多模态大模型在文档图片理解方面展现出巨大的潜力,能够处理多种类型的文档,如表格、图表、网页等。
- 挑战:现有的多模态语言模型(MLLM)在处理文档图片时面临多个挑战,包括:
- 文字图片的多样化(类型、形状、大小)。
- 多样的文档任务形式(信息抽取、问答、自然语言推理等)。
- 复杂的结构布局对语义理解的影响。
- Chart问答对多步推理和数学计算能力的要求。
- 特殊场景(如论文理解)需要外部知识支持。
mPLUG-DocOwl系列工作
- 模型特点:
- 形状适应的切图模块:能够处理不同形状和大小的文档图片,提升模型的适应能力。
- 多任务联合学习:通过多任务学习提升模型在不同任务上的表现。
- 统一的结构学习:DocOwl 1.5通过统一结构学习显著提升了多模态文档理解效果。
- 视觉语言对齐结构 HReducer:采用基于卷积的HReducer模块,将视觉特征对齐到语言特征,保持文字的横向排布特性。
- 训练方法:
- 结构感知解析:包括文档解析、表格解析、图表解析、自然图像解析等。
- 多粒度文字定位与识别:通过文本识别和文本定位,增强模型对文字内容的理解。
- 辅助任务:包括文本阅读和要点生成,提升模型的基础文字识别能力和高层次语义理解能力。
mPLUG-DocOwl开源实战
- 开源项目:mPLUG-DocOwl及相关项目如UReader、X-PLUG、AliceMind、DELTA等,均被开源,便于社区参与和进一步研究。
- 训练数据:
- DocStruct4M:包含大量文档、表格、图表等数据,用于结构感知解析。
- DocReason25K:基于GPT-3.5/GPT-4V构建的多模态文档领域数据集,提供详细的解释,用于模型的微调。
- 模型训练阶段:
- 阶段一:统一结构学习。
- 阶段二:多任务调优,结合已有下游任务和DocReason25K进行训练。
模型性能与实验结果
- 性能对比:在多个任务上,mPLUG-DocOwl表现出色,例如在DocVQA、InfoVQA、DeepForm、KLC、WTQ TabFact、ChartQA等任务中均取得优于其他模型的成绩。
- OCR-free方法:mPLUG-DocOwl在无需OCR的情况下,通过结构感知和多模态对齐,显著提升了模型在文档理解任务中的表现。
- 实验结果:
- DocOwl 1.5:在多个任务中取得显著提升,如在DocVQA任务中达到65.4%,在ChartQA任务中达到118.4%。
- 辅助任务:通过文本阅读和要点生成,增强模型对文档内容的理解和解释能力。
关键信息
- 模型名称:mPLUG-DocOwl
- 研究者:徐海洋,阿里巴巴通义实验室高级算法专家
- 研究方向:多模态大模型在文档理解领域的应用
- 训练数据:DocStruct4M(4,036,402样本)、DocReason25K(25,877样本)
- 模型结构:
- 形状适应的切图模块
- 多任务联合学习
- 统一的结构学习
- HReducer结构感知模块
- 训练方法:
- 结构感知解析
- 多粒度文字定位与识别
- 文本阅读与要点生成辅助任务
- 模型表现:
- 在多个任务中取得SOTA性能
- 在Chart问答任务中通过Program-of-Thought方法解决多步推理和数学计算问题
- 在OCR-free任务中表现出色,无需依赖OCR技术
总结与展望
- 总结:mPLUG-DocOwl系列模型在多模态文档理解领域取得了显著进展,通过结构感知和多任务学习,提升了模型在文档图片理解上的性能和适用性。
- 展望:未来将继续优化模型结构,提升在复杂文档和特殊场景下的表现,同时推动更多开源项目,促进社区协作和模型应用的广泛化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载