东吴证券-多模态技术加速,AI商业宏图正启-2023.12.18-40页_1mb
报告摘要
多模态技术加速,AI商业宏图正启
核心观点:
- 多模态是实现通用人工智能的必经之路,并将成为AI商业发展的起点,能够为企业降本增效,并促进C端内容创作实现成本与质量的平衡。
- 多模态模型处理两种及以上数据类型(如文本、图像、音频、视频、3D等),相比单模态模型,其输入输出能力更强,能更好地模拟真实世界。
多模态大模型技术脉络与前进方向:
- 视觉模型:
- 2D图像生成是当前最容易实现技术突破和产生爆款应用的领域,扩散模型是主流算法,已有成熟应用(如Midjourney、DALL·E、Stable Diffusion)。生成成本仍有优化空间,通用类应用已具备较好的盈利模式。
- 视频生成和3D资产生成是未来重要方向,受到算法(如扩散模型、Transformer结合)、算力和高质量数据集的限制,发展相对较新,仍有较大技术突破空间,预计2024年有望有更大发展。挑战在于数据获取困难、算法复杂度高、计算需求大。
- 视觉模型发展快于听觉和具身智能。
- 音频/听觉模型(音乐生成、语音生成/转换)已有初步突破,但数据集规模相对较小(尤其音乐、低资源语音数据),高质量训练数据仍有缺口。
- 具身智能(AI+机器人)最复杂,需要多模态感知、推理和物理交互能力,目前仍处于早期阶段。
海外与国内进展:
- 海外领先机构(OpenAI、Google、Meta、Stability AI、Midjourney、Runway等)具备技术优势和丰富的生态布局,在多模态领域展现强大实力。
- 国内虽在数据、算法、算力上存在劣势,但海外开源成果(尤其视觉算法)提供了追赶契机。中国科技公司在产品运营和生态整合方面有优势,国产大厂(百度、阿里、字节、腾讯、昆仑万维、商汤等)和AI视觉应用公司(万兴科技、美图)正积极布局,并有望实现技术与应用的同步发展。海外开源模型(如Stable Diffusion)正带动国内开发者生态的繁荣。
投资建议:
- 推荐关注已在多模态方向布局或具备能力的公司: 昆仑万维、万兴科技、美图。
- 看好受益于多模态技术进步的AI应用领域(电商、游戏、教育、营销): 推荐焦点科技、中文在线、盛天网络、蓝色光标、凤凰传媒、世纪天鸿;建议关注掌趣科技。
- 关注AI视频相关多模态技术公司(如虹软、当虹)、算力龙头(如中际旭创)。
主要风险提示:
- 多模态技术发展不及预期。
- 伦理与隐私问题。
- 商业化拓展不及预期。
- 算力基础设施发展不及预期。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载