20230405-浙商证券-人工智能行业专题报告_多模态AI研究框架_17页_6mb
报告摘要
多模态AI研究框架总结
核心内容
多模态AI是人工智能领域的重要发展方向,通过融合文本、语音、图像、视频等多种数据模态,实现更接近人类认知能力的智能系统。其技术发展将推动AI从单模态向多模态演进,未来有望实现认知智能。
主要观点
- 多模态AI的发展由跨模态任务需求、跨模态数据融合和对人类认知能力的模拟三大因素驱动。
- 多模态AI能够处理多种数据形式,适用于复杂任务,如视频分类、情绪分析、视觉问答等。
- 多模态AI以“表征-翻译-对齐-融合-联合学习”五大技术环节为核心,解决实际问题。
- 未来多模态AI生态有望基于现有任务模型构建,实现更广泛的应用场景。
- 多模态AI模型在多个领域展现强大功能,如语言学习、残障交流、图像标注、视频生成等。
关键信息
技术环节
| 技术环节 | 目标 | 技术路线 |
|---|---|---|
| 表征 | 实现模态互补,剔除模态冗余 | 联合表示,协同表示 |
| 翻译 | 模态映射 | Example-based, Decoder-Encoder |
| 对齐 | 模态子成分关联分析 | 无监督方法,监督方法 |
| 融合 | 信息整合 | 早期/晚期融合,多核学习 |
| 联合学习 | 模态知识填充 | Parallel learning, Zero Shot |
多模态AI应用场景
| 架构 | 应用领域 | 融合内容 |
|---|---|---|
| 联合架构 | 视频分类 | 语音、视频、文本 |
| 联合架构 | 事件检测 | 语音、视频、文本 |
| 联合架构 | 情绪分析 | 语音、视频、文本 |
| 协同架构 | 跨模态搜索 | 图像、文本 |
| 协同架构 | 图像标注 | 图像、文本 |
| 编解码器架构 | 图像标注 | 图像、文本 |
| 编解码器架构 | 视频解码 | 视频、文本 |
| 编解码器架构 | 图像合成 | 图像、文本 |
代表模型及功能
| 模型名称 | 功能 | 意义或亮点 |
|---|---|---|
| Whisper | 语音-文本模型,支持语音转录与翻译 | 多模态AI模型有望进入商用时代 |
| CLIP | 文本-图像模型,支持以文搜图 | CLIP的zero-shot learning技术表现优异 |
| DALL-E2 | 文本-图像模型,生成对应图片 | 多模态生成能力显著提升 |
| Make-a-Video | 文本-视频模型,生成短视频 | AIGC进入视频创作领域 |
| GPT-4 | 多模态模型,支持多种任务处理 | 实现更复杂的跨模态推理与交互 |
| Flamingo | 图像-文本模型,实现图文交互 | 将视觉信息与大规模语言模型对齐 |
| Parti | 文本-图像模型 | 支持文本生成图像 |
| LOL Nerf | 2D图像-3D图像模型 | 实现高质量的3D图像生成 |
| Phenaki | 文本-视频模型,实现文本生成视频 | 视频生成技术突破 |
| 文心一言 | 多模态大模型,支持五大能力 | 文学创作、商业文案、数学推理、中文理解、多模态生成 |
技术发展与应用
- 多模态AI的五大核心技术环节共同支撑复杂问题的解决。
- 多模态AI在医疗、教育、金融、交通、政务等多个领域有广泛应用。
- 多模态AI模型如Whisper、CLIP、Make-a-Video等已进入商用阶段。
- 模型性能显著提升,例如在事实性问答、图像解释、视频生成等任务中表现优异。
重点标的
- 基础层:三六零、科大讯飞(大模型)、海天瑞声(数据服务)
- 应用层:
- AI+工具:金山办公
- AI+建筑:广联达
- AI+法律:通达海
- AI+医疗:创业慧康、久远银海
- AI+教育:科大讯飞
- AI+网安:安恒信息、奇安信
- AI+金融:同花顺
- AI+交通:佳都科技
- AI+政务:拓尔思
- AI+遥感:航天宏图
风险提示
- AI技术发展不及预期:当前多模态AI模型仍存在技术缺陷,发展尚未成熟。
- 版权、伦理和监管风险:AIGC内容可能涉及版权问题,不当使用或模型问题可能导致不良后果。
行业投资评级
- 看好:行业指数相对于沪深300指数表现 $+10%$ 以上;
- 中性:行业指数相对于沪深300指数表现-10%~+10%以上;
- 看淡:行业指数相对于沪深300指数表现-10%以下。
法律声明
本报告由浙商证券股份有限公司制作,内容基于公开资料,不构成投资建议,仅供客户参考。使用本报告需注意相关风险,未经许可不得复制、发布或传播。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载