计算机行业AIGC系列深度之24:GPT_4v如何实现强大多模态,从文生图到图生文-20231009-申万宏源-37页_2mb
报告摘要
GPT-4V 如何实现强大多模态:从文生图到图生文
核心内容
GPT-4V 是 OpenAI 推出的多模态模型,它在多个方面展示了强大的能力,包括图像读取与理解、语音对话与生成,以及文本-图像交互处理。该模型不仅在功能上实现了突破,还为多模态 AI 应用打开了新的空间,预计将在工业、医疗、金融等多个领域产生应用价值。
主要观点
- GPT-4V 展现了超越市场预期的多模态能力,支持交错图像-文本输入,具备指令跟随、思维链、上下文少样本学习等先进特性。
- 多模态能力的实现基于强大的语言模型基础,采用了类似 Flamingo 的交叉注意力机制,大幅节约了训练成本。
- GPT-4V 在安全方面进行了大量优化,减少了幻觉、越狱指令和刻板印象、仇恨问题等风险。
- 通过 CLIP 等高质量联合训练数据集,GPT-4V 实现了对图像和文本的精准理解。
- 并行计算策略和高达 175B 参数的 Davinci 模型 3 倍的推理成本,为 GPT-4V 的性能提供了支撑。
关键信息
技术基础
- ViT (Vision Transformer):首次将 Transformer 架构应用于计算机视觉任务,实现了图像处理的突破。
- CLIP (Contrastive Language-Image Pre-Training):用于将文本和图像进行对应,通过抓取网络上的文本-图像数据集(约4亿张图像及描述)进行训练。
GPT-4V 的能力
- 图像-文本交互能力:支持图像和文本混合输入,包括图片标注、图像理解、图像生成等。
- 思维链与少样本学习:支持按照指令一步一步思考,完成图像理解、文本生成等任务。
- 视觉推理与多模态任务:包括图像识别、图像描述、视觉笑话理解、工业缺陷检测、医疗影像分析等。
- 时间与视频理解:通过输入关键帧,理解事件前后关联,完成视频内容分析。
微软 AI Copilot 更新
- AI Copilot 功能:9月26日发布,支持在多个APP和设备运行,包括图文生成、图片理解、AI编辑P图等功能。
- Office Copilot 功能:11月1日将全面开放,支持在 Word、Excel、PPT、OneNote 中使用,提升办公效率。
- 办公软件提价:微软 AI Copilot 功能将带来办公软件的提价机会,如 NotionAI 和 WPS AI 的提价。
Google 多模态进展
- Palm-E:562B 参数的多模态大模型,支持图像理解、语言生成与多种具体任务,如机器人操作规划、视觉问题解答等。
- Gemini:Google 正在研发的下一代多模态模型,预计参数量达到万亿级别,训练数据集规模约为 GPT-4 的两倍,算力需求是 GPT-4 的 5 倍。
重点应用领域
- 工业缺陷检测:通过图像分析识别产品中的缺陷。
- 医疗影像识别:GPT-4V 能够生成医疗报告,理解医学图像。
- 具身智能交互:通过图像和语言进行机器人操作、视觉笑话理解等。
- 汽车保险评估:利用图像信息进行事故分析和保险定价。
推荐标的
- 金山办公:直接对标微软 Copilot,AI能力融入办公软件,提升付费率和ARPU值。
- 福昕软件:面向海外B端客户,率先将AIGC能力融入PDF产品线。
- 万兴科技:受益于OpenAI图片能力升级,具备多模态应用潜力。
- 大华股份:多模态+视频分析,有望在能源等行业率先落地应用。
风险提示
- 大模型技术中美仍存在差异,部分技术尚处于早期实验室阶段,存在落地风险。
- 实体清单等可能对训练硬件产生影响,限制模型发展。
有别于大众的认识
- GPT-4V 的多模态能力来源于 Flamingo 架构的交叉注意力机制,而不是直接训练多模态模型。
- Google 的 Palm-E 和 Gemini 等模型也值得期待,其训练算力和数据集规模远超 GPT-4。
- 多模态模型的进入门槛较高,需在 AI 架构、Prompt、RLHF、安全、数据、计算资源等多个方面进行投入。
多模态原理解析
- 文生图:DALL·E3 作为最先成熟的 AIGC 应用,基于 CLIP 进行训练,能够根据文字描述生成高质量图像。
- 图生文:通过语言模态的引入,视觉模型的泛化能力显著提升,特别是在 Few-shot 和 Zero-shot 任务中表现优异。
- 模型结构:多模态模型的典型结构包括合并注意力、共同注意力、交叉注意力、三角 Transformer 和模态间对比学习等。
未来展望
- GPT-4V 的发布标志着多模态 AI 应用的加速发展。
- 随着多模态能力的提升,AI 在办公、工业、医疗等多个领域的应用将进一步拓展。
- 未来应重点关注多模态模型的安全性、产品提价能力和实际应用场景落地。
图表目录(简要)
- 图1:图文对话示例
- 图2:复杂图表理解
- 图3:DALL·E3 图像生成能力
- 图4:交错图像-文本输入
- 图5:思维链能力
- 图6:上下文少样本学习
- 图7:图像描述
- 图8:视觉推理
- 图9:图像标注
- 图10:图像生成预测
- 图11:图像排序
- 图12:视频理解
- 图13:工业缺陷检测
- 图14:医疗影像分析
- 图15:不同模型生成效果对比
- 图16:AI设计工具示例
- 图17:Excel 自动分析
- 图18:OneNote 笔记草稿
- 图19:多模态预训练模型发展
- 图20:DALL·E 图像生成示例
- 图21:DALL·E-2 图像生成示例
- 图22:CLIP 数据集
- 图23:CLIP 核心思路
- 图24:视觉 zero-shot 示例
- 图25:视觉任务分类
- 图26:GPT-4 图像理解示例
- 图27:多模态模型结构
- 图28:Flamingo 架构
- 图29:Flamingo 数据集
- 图30:多模态提示示例
- 图31:ViT 核心思路
- 图32:PaLM-E 核心思路
- 图33:PaLM-E zero-shot 推理
- 图34:Google Bard 多模态更新
- 图35:Gemini 预测
- 图36:Gemini 预测
- 图37:GPT-4V 拒绝越狱请求
- 图38:GPT-4V 拒绝不安全行为
- 图39:GPT-4 科学知识风险
- 图40:GPT-4V 修正刻板印象回答
- 图41:GPT-4V 修正误导信息回答
- 图42:Doulingo 提价
- 图43:NotionAI 提价
- 图44:WPS AI 全面接入
- 图45:WPS AI 提升付费率
- 图46:WPS365 上线
- 图47:福昕软件 AIGC 融入
- 图48:Filmora 使用 ChatGPT
- 图49:思维导图使用 AI 功能
表格目录(简要)
- 表1:视觉 FSL 分类
- 表2:AIGC 融入后的典型提价应用
- 表3:金山办公 C 端空间测算
- 表4:福昕编辑器订阅制与授权制价格
- 表5:AI 行业重点公司估值表
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载