AIGC时代的多模态知识工程思考与展望-复旦大学_50页_11mb
报告摘要
AIGC时代:多模态知识工程的机遇与挑战
李直旭(复旦大学研究员、博导)在DataFunSummit2023论坛中探讨了生成式人工智能(AIGC)与多模态知识图谱(MMKG)的协同发展。AIGC技术已实现文本、图像、音频、视频等多模态生成,如ChatGPT、StableDiffusion、PaLM-E等模型推动了AI在内容创作领域的突破。然而,AIGC存在知识储备不足、逻辑推理薄弱、信息不对称等问题,例如在跨模态生成中易出现属性泄露、方位认知混乱、语义理解偏差等错误。
多模态认知智能:融合符号主义与连接主义
多模态知识图谱(MMKG)是当前多模态知识工程的核心形式,通过将图像、视频等数据与传统知识图谱结合,实现跨模态语义对齐。MMKG可分为两种类型:一种将多模态数据作为实体,另一种作为属性值。研究指出,AIGC与MMKG需互补共存,前者具备跨模态生成能力但仍缺乏可靠性和解释性,后者则可通过结构化知识提升AI的推理和可解释性。
AIGC对MMKG的赋能
AIGC技术显著提升了知识获取效率,通过零样本/少样本学习、多模态数据关联等手段,降低知识抽取成本。例如,利用多模态大模型辅助构建知识库、设计图谱Schema、实现知识融合与更新,并通过外部信息源增强MMKG的动态性。同时,AIGC还能优化跨模态生成质量,如通过检索增强的生成方式(如Re-Imagen)提升图像内容的准确性。
MMKG对AIGC的反哺
MMKG通过显式结构化知识引导AIGC实现可控生成与领域适配,例如在文本生成中嵌入约束条件,或利用行业特色知识库提升模型的垂直领域能力。研究提出,未来可探索因果知识增强、个性化知识接入等方向,将MMKG与AIGC结合,形成立体化的认知框架。
协同发展路径
AIGC与MMKG的协同模式包括:知识注入增强大模型(如Ernie-vil),知识检索辅助生成(如Re-Imagen),因果知识引导决策(如GraphEnhancedBERT),以及多模态知识库与AI工具的结合。这种竞合关系有助于弥合通用大模型与行业应用的鸿沟,推动通用人工智能的发展。
总结
AIGC虽加速AI技术进步,但其知识储备、推理能力和可解释性仍受限。MMKG作为结构化知识载体,可为AIGC提供可靠性和逻辑性支持,而AIGC则为MMKG注入动态能力与泛化性。二者结合将推动多模态认知智能的深化,助力行业应用落地。技术融合需要探索符号知识与统计模型的协同机制,并在产学研层面构建多层次的知识体系。
试读结束,高清完整版pdf/doc/ppt,请点下载