谢春宇:多模态大模型:开放世界理解-49页_6mb
报告摘要
多模态大模型背景与技术发展
多模态大模型定义与发展需求
随着ChatGPT的发布,自然语言处理技术进入新阶段,但AI实现通用智能(AGI)仍需整合多模态能力(如视觉)。GPT-4V和GPT-4O增强的视觉能力(如图像理解、多模态输入输出)推动了跨模态学习的发展,视觉语言对齐成为关键方向。
视觉语言跨模态学习模型演进
从CLIP开始,视觉语言预训练模型不断发展,包括ALIGN、BASIC、DFN等,模型参数从B级(数十亿)发展至大型(数十亿参数模型如R2D2和Zero数据集,支持中文图文检索)。代表性模型有:
- R2D2:23M中文图文数据,采用双塔base+单塔head结构,实现SOTA中文检索性能
- LLaVA系列:从LLaVA到LLaVA-Next,引入更高分辨率支持与更多数据训练
- Idefics2、InternVL2等
技术挑战与路线选择
- 原生多模态路线(如GPT-4O、Gemini)训练成本高但理论上限高
- 缝合路线(image encoder + projector + LLM)更经济,但面临:
- 图文分辨率限制问题
- 视觉与语言任务竞争问题
- 模型扩展律(scaling law)疑问
360多模态大模型应用
360采用单模态专家缝合路线构建SEEChat(360VL前身),特点是:
- 严格能力超集:视觉能力不影响原有语言模型能力
- 目标视觉定位(OVD):可精准识别图像位置
- 实验效果验证:支持多轮对话及多场景理解
360VL开源模型表现优异,在MMMU图像理解测试中排名第一,支持9大类常见视觉任务。其业务实践包括:
- 智能硬件集成(如儿童手表拍照学英文,公测评分91分)
- 图像标签化:动态识别开放世界物体标签
- 视频质检:不存在人、卫生不合格等自动化巡检能力
- 已服务超5万家企业,应用场景覆盖连锁门店巡检等
未来展望
多模态大模型将在未来成为主流AI平台基础设施,提供文本、图像、视频等多模态融合能力,“开放世界理解”是核心方向之一,未来将广泛应用于办公自动化、机器人、自动驾驶等领域。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载