20260729-东吴证券-汽车行业点评报告_AI系列深度05期_模型如何学习表征并实现对齐_6页_466kb
报告摘要
汽车行业点评报告总结
核心内容概述
本报告围绕“表征学习”展开,探讨了AI模型如何学习和组织表征,以及如何实现跨模态对齐。报告从嵌入、自监督学习和CLIP三类基础机制入手,分析了它们在表征工程、规模化学习和多模态对齐中的作用,并指出这些机制是理解后续技术路线和多模态模型发展的基础。同时,报告也对AI在物理世界中的应用前景进行了展望,并提出了相关风险提示。
主要观点
1. 表征学习的三大基础机制
- 嵌入:将对象(如文本、图像、商品、用户)映射为数字向量,实现语义关系的几何化表达。
- 自监督学习:通过利用数据自身构造训练信号,实现对大规模无标注数据的高效学习,是预训练模型形成通用能力的关键。
- CLIP:通过对比学习,将图像和文字映射到同一语义空间,为多模态应用提供基础支持。
这三类机制共同构成了从抽象表征到具体应用的完整链条。
2. 嵌入的应用场景
- 检索:通过向量距离判断语义相似度,实现高效搜索。
- 向量数据库:存储对象的向量表示,支持快速近邻检索。
- RAG(Retrieval-Augmented Generation):结合向量检索与大模型生成能力,解决知识更新与私有数据的问题。
3. 自监督学习的必要性与任务类型
- 必要性:人工标注成本高、数据量大,自监督学习成为规模化训练的可行路径。
- 任务类型:
- 掩码预测:如BERT(文本)、MAE(图像)。
- 对比学习:如SimCLR、JEPA。
- 下一个 token 预测:如GPT系列。
4. CLIP的跨模态对齐能力
- 意义:使图像与文字进入同一语义空间,为文生图、图文检索、视觉语言模型等提供基础。
- 零样本识别:通过文字向量与图像向量的对比,实现无需额外训练的识别能力。
- 多模态底座:CLIP成为构建多模态模型的重要技术基础。
关键信息
- 表征的工程化:嵌入是将对象转化为向量的核心手段,支持多种AI应用场景。
- 自监督学习:是预训练模型形成通用能力的关键机制,解决了标注数据不足的问题。
- CLIP的跨模态对齐:通过大规模图文配对数据和对比学习,实现图像与文字的语义对齐。
- AI发展方向:数字AI底座模型已较为成熟,但物理AI在AI发展过程中具有更大的增量潜力。
- 智能驾驶的前景:作为物理AI的代表场景,智能驾驶是当前AI技术落地的重要方向。
风险提示
- 技术迭代不及预期:数字AI与物理AI技术进展可能低于预期,任务或应用场景拓宽速度可能受限。
- 大模型ARR增速放缓:若客户增长、续费率或客单价不及预期,模型厂商的ARR(年度经常性收入)增长可能放缓。
- 云服务商资本开支不足:若AI算力需求或投资回报低于预期,云服务商可能减少资本开支。
- 智能驾驶与机器人商业化落地不及预期:产品可靠性、成本下降或用户需求不足可能导致商业化进程受阻。
投资建议
- 投资评级:本报告为“增持”评级,预期未来6个月个股涨跌幅相对基准介于5%与15%之间。
- 行业前景:AI技术在多模态和物理AI方向具备广阔的发展空间,尤其是智能驾驶作为最先跑通闭环的场景,值得重点关注。
相关研究
- 《AI 系列深度 04 期: 什么是表征?》
- 《AI 系列深度 03 期: 数字 AI 与物理 AI 的边界在哪里?》
东吴证券研究所信息
- 地址:苏州工业园区星阳街5号
- 邮政编码:215021
- 传真:(0512)62938527
- 公司网址:http://www.dwzq.com.cn
- 分析师:黄细里
- 执业证书:S0600520010001
- 联系方式:021-60199793 | huangxl@dwzq.com.cn
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载