计算机行业专题研究:多模态加速燃烧算力_27页_3mb
报告摘要
多模态加速燃烧算力
核心内容
本报告分析了多模态大模型的发展趋势及其对算力需求的显著影响,特别是GPT-4V的发布标志着多模态时代的正式开启。报告指出,多模态模型在多个领域表现出卓越的性能,并推动了算力需求的持续增长,同时为下游应用带来了更广泛的可能性。
主要观点
- 多模态是AI发展的必然趋势:随着人工智能技术的进步,多模态模型正逐步成为主流,因其能够整合多种数据源,实现更全面的信息理解和处理。
- GPT-4V性能突出:在视觉-语言、视觉标记提示、时间与视频理解、抽象视觉推理、情商测试等方面表现优异,展示了其在多模态任务中的强大能力。
- 算力需求显著上升:与GPT-3相比,GPT-4在同等训练时长下算力需求增长了445倍,而多模态模型的训练和推理阶段对算力的需求将持续增长。
- 多模态模型应用场景广泛:包括工业、医学、汽车保险、自定义字幕生成器、图像智能、具身智能等,能够打破单模态模型的局限性。
- 算力租赁模式具备可行性:随着模型训练和推理需求的爆发,算力租赁成为一种可行的商业模式,进一步推动算力相关企业的投资机会。
关键信息
投资建议
- 推荐标的:神州数码、浪潮信息、拓维信息、恒润股份、淳中科技
- 受益标的:紫光股份、中科曙光、四川长虹、真视通、中国长城、莲花健康、鸿博股份、润建股份、中贝通信、烽火通信、恒为科技
- 评级:增持
- 细分行业评级:计算机 增持
多模态模型的发展历程
- 计算时代(1980-1999):早期研究主要集中在视觉和语音联合识别、多模态情感分析等领域。
- 交互时代(2000-2009):研究重点转向用户交互,如语音助手Siri的出现。
- 深度学习时代(2010至今):借助深度学习技术,模型准确性和复杂性大幅提升,CLIP、DALL-E2、BEiT-3等模型相继推出。
多模态与单模态模型的差异
| 项目 | 单模态模型 | 多模态模型 |
|---|---|---|
| 数据输入 | 单一类型的数据(如文本或图像) | 多种类型的数据(如图像、文本、声音) |
| 数据处理 | 针对特定类型数据进行优化 | 需要处理多种数据源并进行融合 |
| 模型架构 | 专为特定数据类型优化 | 需要处理、解析和融合多种模态信息 |
| 学习策略 | 学习单一数据源的模式 | 学习跨模态之间的关系和语义关联 |
| 应用领域 | 限于单一数据类型任务 | 应用于更广泛和复杂的任务 |
GPT-4V的多模态能力
- 视觉-语言能力:能够识别名人、地标、食物、医学图像等,并描述其背景信息。
- 视觉标记提示:支持图像上的标记和坐标,增强交互能力。
- 视觉和时间维度理解:能够解析图像和视频,理解时间序列信息。
- 抽象视觉推理:处理抽象视觉刺激,如笑话和表情包的解读。
- 多语言支持:支持多种语言的图像描述和翻译,如中文、法文、捷克文、英文等。
- 代码生成能力:可将手写、图像表格、图形转化为代码,如LaTeX、Markdown、Python、TikZ、SVG等。
风险提示
- 应用端发展进度低于预期
- 政策风险
- 企业管理风险
相关报告
- 计算机《视频监控安全新标准发布,商用密码行业需求有望爆发》(2023.10.31)
- 计算机《江淮接力赛力斯,华为智选模式高歌猛进》(2023.10.29)
- 计算机《增发国债有望扭转政府信息化投资预期》(2023.10.25)
- 计算机《美国加大制裁,国产AI算力重要度跃升》(2023.10.18)
- 计算机《华为鸿蒙生态攻坚克难,自主可控正当时》(2023.10.16)
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载