复旦大学:AIGC时代的多模态知识工程思考与展望_50页_10mb
报告摘要
AIGC时代:未来已来
生成式人工智能(AIGC)随着技术迭代迅速发展,涵盖文本、图像、音频及视频生成。代表技术如ChatGPT、StableDiffusion、DALL-E等已广泛应用于创作与交互场景。多模态大模型进一步发展为文图生成模型及统一大模型,谷歌PaLM-E结合了传感器数据与语言能力建立感知-语言连接,推动具身智能发展。
然而,AIGC也面临严峻挑战,包括知识不足、常识储备缺失、逻辑推理欠缺以及生成内容可靠性问题。跨模态生成存在属性泄露、方位混乱、语义错误等现象,多模态大模型知识获取仍依赖低质量数据,且难以进行因果推理。
AIGC的阿克琉斯之踵
AIGC在文本生成方面存在问题,例如:知识过时、逻辑推理缺陷与事实错误。机器学习模型过度依赖规模和数据,但却无法解决真正复杂的推理挑战。多模态生成虽具视觉吸引力,却表现出跨模态不一致性、语义理解错误、背景缺乏理解等缺陷。模型对视觉信息的语言解释能力和从视觉完善语言的理解仍不成熟,部分源于数据质量差、知识表达不全及推理能力不足。
多模态认知智能
多模态认知智能致力于通过多模态数据的知识获取、表示、推理与应用推动AI发展。研究框架包括跨模态理解、生成、推理与问答,以及常识理解和因果推理。其实现路径包括连接主义(统计学习)与符号主义(知识工程),结合了统计关联与显性知识推理。
多模态知识图谱(MMKG)是多模态知识工程的核心形式。它通过多种模态数据增强传统知识图谱,支持跨模态语义对齐,但构建成本高、推理能力弱,无法应对复杂场景。
AIGC与MMKG的竞争与协作
多模态大模型与MMKG在具体场景下应互为补充。大模型生成能力强大,训练成本低,可通用于多种任务,但其生成结果可靠性不高,逻辑可解释性不足。相比之下,MMKG知识结构清晰,可解释性强,能为某个具体场景提供精准支持,但知识推理能力较弱、训练成本高,且缺乏泛化能力。
AIGC已成为MMKG知识获取的有效助手。它可以加速知识抽取、辅助知识图谱构建、提高知识融合效率并辅助知识更新与问答系统设计。反过来,MMKG也为AIGC提供结构化、可控的知识支持,如增强其生成的可控性与具体任务能力。
AIGC+MMKG的协同应用
通用人工智能和复杂领域应用的实现离不开AIGC与MMKG的协同发展:
- 知识增强的预训练大模型:向预训练模型注入知识,提升其知识掌握能力。
- 检索增强生成:利用外部检索数据增强模型生成能力,使其生成更贴合需求。
- 因果知识增强:引入因果关系,提升AIGC在决策中的推理性。
- 个性化知识接入:个性化多模态知识库的可插拔式接入将进一步提高大模型的生成能力。
面向行业落地场景,多层次模型与知识库、外部工具的配合成为趋势。大模型处理行业通用任务,而专业领域模型与知识库则解决具体应用问题。
总结
ü AIGC推动通用人工智能发展,但仅靠大模型不足以实现其目标。
ü 多模态知识工程依然不可或缺,MMKG具有特有的可信性与可解释性。
ü AIGC与MMKG应竞合并进,实现“AIGCforMMKG”与“MMKGforAIGC”的协同。
双方合作不仅有助于学术发展,也为实际落地场景提供了有效路径,最终推进通用人工智能、高效生产力与行业复杂应用场景的解决路径。
试读结束,高清完整版pdf/doc/ppt,请点下载