传媒图像篇专题(一)-开源模型高速迭代-StableDiffusion促进AI技术民主化-上海证券_16页_1mb
报告摘要
图像篇专题(一)总结:开源模型高速迭代,Stable Diffusion促进AI技术民主化
核心内容概述
本文围绕“AI+传媒”的研究框架,重点分析了开源图像生成模型 Stable Diffusion 的技术特点、行业影响及投资建议。文章提出,AI技术在传媒行业的应用效果取决于两个关键因素:通用大模型的适配程度 和 行业小样本的数据质量与数量。Stable Diffusion 作为当前可用性高的开源模型,凭借其多模态特性、快速迭代能力和广泛的开发者支持,正推动图像生成技术的普及和应用创新。
主要观点与关键信息
1. 通用大模型与行业小样本的结合
- 适配程度:大模型的输入与输出模态是否匹配垂类应用需求,例如 GPT-4 的“图+文”输入与“文”输出,更适合与“图或文”输入、“文”输出的垂类应用结合。
- 迭代速度:行业小样本的数据量与质量决定了大模型在垂类场景中的再训练能力,数据越丰富、质量越高,越有利于大模型能力的提升。
- 调用与训练:
- 能力调用:通过直接调用通用大模型的通用能力,快速提升垂类应用的效率,适合内容供给量大的场景,如文本、虚拟人等。
- 能力训练:利用垂类数据对通用大模型进行再训练,形成专属模型,适合内容质量高但数量有限的场景,如影视、游戏等。
2. Stable Diffusion 技术特点与演进
- 开源优势:Stable Diffusion 是一个开源模型,由多个研究团队合作开发,基于 CVPR2022 论文,具有极高的灵活性与可扩展性。
- 多模态支持:支持文本到图像生成,且通过插件如 ControlNet 可实现图像的可控生成,极大提升了 AI 绘画的实用性与稳定性。
- 版本迭代:
- V1版本:发布于2022年8月,支持在消费级GPU上快速部署,生成512x512像素图像,推动图像生成技术民主化。
- V2版本:发布于2022年11月,引入 OpenCLIP 文本编码器、Upscaler Diffusion 超分辨率模型、Depth2img 深度引导模型及文本引导修复模型,显著提升了图像质量与多样性。
- V2.1版本:优化了人像过滤机制,提升了图像质量,增强了“否定提示”功能,使用户能更精细地控制图像生成。
3. 商业模式与版权挑战
- 商业模式:Stable Diffusion 由 Stability AI 资助开发,但目前公司营收不足以覆盖服务器与人才成本,仍处于商业模式探索阶段。
- 版权问题:由于开源特性,Stable Diffusion 面临艺术版权归属不明、监管难度大等问题,限制了其在ToC场景中的商业化应用,企业更倾向于在ToB场景中使用生成图像结果以规避风险。
4. 投资建议
- 关注AI+文本/虚拟人板块:因其与通用大模型的适配度高,是当前AI技术应用的优先领域。
- 关注掌握优质数据与内容的公司:如芒果超媒、汤姆猫、昆仑万维、神州泰岳、华凯易佰、创梦天地、浙文互联、视觉中国、新华都、值得买、遥望科技、壹网壹创、青木股份、若羽臣、丽人丽妆、福昕软件、光云科技、力盛体育、汇纳科技等。
- AI+内容/IP/版权板块:因其具备高质量数据与内容,未来价值重估空间较大。
行业前景与风险提示
行业前景
- 技术民主化:开源模型如 Stable Diffusion 降低了AI图像生成的门槛,推动了技术的快速普及与应用。
- 多模态发展:随着GPT-5等模型支持更多模态,AI+视频、影视、游戏等场景的适配与应用潜力将进一步释放。
- 内容价值提升:掌握优质内容与数据的公司将在AI+传媒领域中占据优势,版权与内容IP的价值有望被重新评估。
风险提示
- 宏观经济风险:AI技术研发与应用成本高,若宏观经济环境变化可能影响企业盈利能力。
- 地缘政治风险:涉及数据安全与跨境业务的公司可能面临政治与政策风险。
- 技术发展不及预期风险:通用大模型与垂类应用的结合效果可能低于预期。
- AIGC行业发展不及预期风险:若底层通用大模型发展缓慢,可能抑制下游小模型及应用的发展。
结论
Stable Diffusion 作为开源图像生成模型的代表,凭借其快速迭代、多模态支持与社区协作,正在推动AI图像生成技术的普及与应用创新。从投资角度看,应优先关注适配性高、数据与内容质量优异的标的,以捕捉AI+传媒行业的发展红利。同时,需警惕宏观经济、地缘政治及技术发展等方面的潜在风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载