AIGC时代的多模态知识工程思考与展望-复旦大学_50页_10mb
报告摘要
李直旭在《AIGC时代的多模态知识工程思考与展望》中提出,生成式人工智能(AIGC)技术正推动多模态知识图谱(MMKG)发展,但二者仍需协同发展。以下为主要内容总结:
-
AIGC时代特征
AIGC通过文本、图像、音频、视频等多种形式实现内容生成,如StableDiffusion、DALL-E等模型在艺术创作和视频生成领域表现突出。谷歌PaLM-E等多模态大模型通过融合传感器数据和文本输入,初步实现具身智能,但其应用场景仍局限于封闭空间、有限物品种类和简单任务,参数量可能需提升百倍甚至千倍才能达到实用级别。 -
AIGC的局限性
当前AIGC存在三大问题:①跨模态生成能力不足,如组合泛化、属性泄露、方位理解混乱导致语义错误;②缺乏常识和逻辑推理,难以准确回答领域问题(如医疗、法律);③数据质量依赖性强,海量参数可能带来信息冗余和隐性知识损失。例如,PaLM-E在场景理解中出现错误判断,如误将冲浪板与潜水装备关联。 -
多模态认知智能框架
多模态认知智能需实现“语言解释视觉,视觉完善语言”的双向关联,其研究框架包括数据抽取、知识表示、跨模态推理与应用等环节。核心技术路径分为符号主义(多模态知识工程)和连接主义(多模态大模型),前者依赖人工Schema设计,后者通过统计学习实现端到端处理,但存在可解释性差、训练成本高的缺陷。 -
AIGC与MMKG的协同应用
- AIGC助力MMKG建设:通过零样本/少样本学习、图谱设计自动化、知识推理增强、实体对齐优化等方式提升知识获取效率。例如,利用大模型抽取文本三元组或跨模态知识,辅助知识库更新与过期信息检测。
- MMKG赋能AIGC:多模态知识图谱可约束大模型生成内容,通过知识编辑、领域适配、因果推理等路径增强生成可控性与准确性。例如,基于MMKG构建测试集评估生成能力,或通过知识注入提升模型任务理解力(如Ernie-ViL模型)。
-
技术融合方向
未来需探索AIGC与MMKG的深度协同:①知识注入增强大模型语义理解,②检索增强跨模态生成,③因果知识优化决策逻辑,④个性化知识接入提升生成针对性。行业应用层面,通用大模型需结合领域知识库与专用工具(如Microsoft 365 Copilot)解决实际问题,形成“基础大模型+行业数据+任务小模型”的多层次架构。 -
结论与展望
AIGC虽加速AI发展,但无法独立实现通用人工智能,需与知识图谱技术结合。多模态知识工程在跨模态对齐、领域适配、知识推理等方面仍具不可替代价值,两者应构建竞合关系:AIGC为知识获取、推理提供效率,MMKG为AIGC提供结构化知识支持。最终目标是实现符号知识与统计模型的协同,推动多模态认知智能向通用人工智能演进。
试读结束,高清完整版pdf/doc/ppt,请点下载