殷述康-多模态大语言模型领域进展分享-2024-42页_4mb
报告摘要
报告:多模态大语言模型领域发展分享总结
演讲人:殷述康(博士在读)
主题:多模态大语言模型(MLLM)的研究进展与未来展望
一、背景与演进
-
LLM向多模态扩展:
- 大语言模型(LLM)虽能处理传统NLP任务,但限制于文本输入,难以应对多模态任务,如图片理解、生成代码等。
- 多模态大语言模型(MLLM)应运而生,主要用于视觉与语言相关的任务,底层依托OpenAI、谷歌等开源或闭源模型,并推动了AI多模态的进步。
-
多模态任务能力:
- MLLM可执行文本生成、图像描述、图表推理、图像/视频识别、问答等。
- 新兴任务:如基于视觉的对话、多模态生成、图文结合,增强了应用场景的丰富性。
二、模型架构与训练方法
-
MLLM三要素架构:
- 编码器:用于图像处理,以ViT(Vision Transformer)为基础。
- 连接器:用于融合视觉和语言模态,包括MLP或Q-Former,提升特征提取效率。
- 语言模型:用于文本生成,与CLIP等预训练模型结合。
-
训练过程:
- 第一阶段:模态对齐训练,通过图文配对数据对视觉与语言特征空间进行对齐,如图文生成。
- 第二阶段:指令微调,利用VQA、文本生成等多任务数据进行训练,提升模型泛化能力。
三、最新研究与演进
-
分辨率与输入支持优化:
- 采用更高分辨率图像增强感知准确度(如Qwen-VL从224×224升至448×448)。
- 模型从单图延伸至多图、视频输入与处理。
-
多模态输出扩展:
- 支持图像生成、音频、视频生成等,融合文本与其他模态的输出。
- 统一代价机制:如扩充词表集成图像噪声生成图像,实现图文交错联立。
四、团队工作亮点
-
幻觉缓解机制:
- 通过Woodpecker框架整合基础视觉模型作为提示,修正语言模型在视觉描述任务中的概括偏差。
- 在多个开放数据集上实验,增强视觉逻辑推理与语义一致性。
-
长视频理解评测(Video-MME):
- 创建了长视频评测基准,解决了传统数据集无法有效评估宏观背景理解的问题。
- 在视频推理、物体关系、全局时间感知等方面填补了现有模型的能力短板。
-
多模态交互体验优化(VITA):
- 设计实时交互框架,通过噪声抑制和双引擎机制实现多模态多任务同原生单模态对话的响应质量。
五、未来展望
-
技术挑战与方向:
- 支持更长上下文,压缩视觉令牌。
- 抽象思维与多模态整合,提升多模态Agent(如手机自动化助手)的可部署性。
- 统一模态训练与推理流程,支持实时自然对话交互。
-
研究与应用目标:
- 实现轻量化模型部署,降低MLLM在设备端运行门槛。
- 推动生成型应用开发,如实时内容生成、多模态融合任务,拓宽多模态模型在互联网内容创作中的实用场景。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载