软件与服务行业证券研究报告:大模型技术进化论系列_21页_2mb
报告摘要
多模态大模型综述总结
核心内容
多模态大模型通过融合语言模态与图像模态,提升了AI模型对信息的理解与处理能力。相比传统大语言模型与机器视觉模型,多模态模型具备更强的场景匹配度与应用拓展性,能够同时处理文本与图像数据,实现更复杂的任务和更广泛的应用场景。其技术路径是从大语言模型发展而来,逐步拓展至多种模态的融合,以模拟人类大脑的信息处理方式。
主要观点
- 多模态模型将语言模型的文本理解与思维链能力投射到图像模态,赋予模型图像理解与生成功能。
- 多模态模型通过预训练与调参方式,改变了传统机器视觉高度定制化的模式,提高了模型的泛用性。
- 多模态模型在商业模式上推动了技术对市场的影响,由研发端主导市场趋势。
- 与大语言模型相比,多模态模型能够处理更多模态信息,提升了信息输入规模与信息流密度。
- 与传统机器视觉模型相比,多模态模型具备更高的可迁移性,能够更好地适应不同应用场景。
关键信息
多模态模型的六大任务
- 表征:研究如何表示和总结多模态数据,反映各模态之间的异质性与联系。
- 对齐:识别不同模态元素之间的连接和交互,是多模态模型训练的主要瓶颈。
- 推理:从多模态证据中合成知识,通常通过多个推理步骤完成。
- 生成:学习生成过程,生成跨模态交互与结构的输出。
- 迁移:通过调参方式,使模型适应不同垂类场景。
- 量化:研究模型结构与工程化落地方式,以提升模型的鲁棒性、可解释性与可靠性。
技术路径与模型结构
- 多模态模型从语言-图像融合开始,逐步泛化至其他模态。
- 模型结构分为双流与单流两种方式:
- 双流:分别对文本与图像进行编码,再通过Cross Transformer融合,如ViLBERT、Visual Parsing。
- 单流:将两种模态同时输入一个编码器,如VL-BERT、ViLT。
- 多模态模型具备较高的信息密度与直观性,更符合人机交互习惯。
应用落地与产业趋势
- OpenAI于2023年9月25日开放了GPT-4的多模态能力,提升了模型的鲁棒性与安全性。
- DALLE-3作为文生图模型,具备更强的细节识别能力与与ChatGPT的深度整合,降低了使用门槛。
- 多模态模型在医疗、教育、办公、工业等核心赛道具有快速渗透潜力,或将催生大量爆款应用。
- 多模态模型的普及将推动AI公司在算力端展开新一轮军备竞赛,建议关注英伟达链与华为昇腾链相关厂商。
- 多模态模型有望实现人形机器人“端到端”的方案,整合感知与决策模块,提高系统鲁棒性与效率。
风险提示
- 人工智能技术发展不及预期。
- 人工智能下游应用需求不及预期。
投资评级说明
- 行业评级:看好、中性、看淡。
- 公司评级:买入、增持、中性、减持、无投资评级。
- 相关证券市场代表性指数:A股以沪深300为基准,港股以恒生指数为基准。
场景匹配度提升
- 图像模态与物理世界更贴切,信息密度更高,交互方式更直观,应用门槛更低。
- 多模态模型通过提升场景匹配度,有望在多个核心领域快速落地,推动AI技术更广泛的应用。
技术挑战与发展方向
- 对齐任务是当前多模态模型训练的最大挑战,涉及跨模态的复杂交互关系。
- 算力瓶颈仍是多模态模型训练与推理的主要限制因素。
- 未来多模态模型可能融合更多模态(如声音、触觉等),以应对更复杂的场景需求。
模型类型与示例
| 模型名称 | 文本编码器 | 图像编码器 | 融合方式 |
|---|---|---|---|
| VisualBERT | BERT | Faster R-CNN | 单流 |
| Uniter | BERT | Faster R-CNN | 单流 |
| ViLBERT | BERT | Faster R-CNN | 双流 |
| CLIP | GPT2 | ViT, ResNet | 双流 |
| ViLT | ViT | Linear Projection | 单流 |
| DALLE-3 | ChatGPT | - | 深度整合 |
总结
多模态大模型代表了AI技术发展的新方向,其融合语言与图像等多模态信息的能力,使其在多个领域具有广阔的应用前景。随着OpenAI等公司陆续发布相关产品,多模态模型的应用落地进程加快,对算力的需求也显著提升。未来,随着更多模态的融合与模型的优化,多模态技术有望成为AI发展的重要推动力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载