> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告:视觉智能与 Transformer 的演进 ## 核心内容概述 本报告分析了视觉智能从卷积神经网络(CNN)向 Transformer 架构演进的过程,探讨了两者在归纳偏置、结构设计、任务适配等方面的根本差异,并总结了视觉 Transformer 在技术发展中的阶段性成果和未来趋势。同时,报告指出视觉智能尚未形成如语言模型那样的消费级交互入口,仍以“感知性”中间能力为主。最后,报告对数字 AI 和物理 AI 的发展方向进行了展望,并提出了相关风险提示。 --- ## 主要观点与关键信息 ### 1. **视觉归纳偏置与 CNN 的优势** - CNN 在 AI1.0 时代成为视觉核心架构,源于其内置的三项视觉归纳偏置: - **局部连接**:仅关注局部邻域,适用于基础视觉模式识别。 - **权重共享**:同一卷积核在图像中重复使用,减少参数量。 - **平移等变性**:图像平移后特征图同步平移,增强鲁棒性。 - 这些偏置使 CNN 在数据规模有限时仍能高效学习,但也限制了其全局建模能力、任务通用性与开放性。 ### 2. **Transformer 进入视觉的关键** - **ViT 的提出**:确立“图像 patch 即 token”的输入方式,将二维图像转化为一维序列,接入标准 Transformer 架构。 - **Transformer 的优势**: - 全局建模能力强,长距离依赖建模效率更高。 - 接口统一,利于跨任务与跨模态迁移。 - 结构可扩展,适配大规模预训练。 - **Transformer 的局限**: - 缺乏视觉归纳偏置,依赖位置编码和大规模数据。 - 计算复杂度随分辨率快速上升,尤其在高分辨率图像中。 ### 3. **视觉 Transformer 的发展阶段** 本报告将视觉 Transformer 的发展归纳为**三个阶段、九个子阶段**: #### **第一阶段:图像被 token 化** - **1.1 注意力视觉化前史**(2017–2019):在 CNN 中引入注意力机制,补足长距离依赖。 - **1.2 图像输入 token 化**(2020–2021):ViT、DeiT 等模型确立图像 token 化范式。 - **1.3 输出 token/query 化**(2020–2021):DETR、SETR 等模型将检测、分割任务改写为序列输出。 #### **第二阶段:可扩展通用骨干** - **2.1 视觉归纳偏置回归**(2021–2022):引入金字塔、窗口注意力等机制,适配多尺度任务。 - **2.2 通用视觉骨干形成**(2021–2023):Swin、PVT 等模型成为通用骨干,支持检测、分割等任务。 - **2.3 CNN 与 Transformer 融合再平衡**(2022–2024):ConvNeXt、InternImage 等模型融合两者优势,实现双向借鉴。 #### **第三阶段:走向视觉基础模型** - **3.1 自监督视觉预训练**(2021–2026):DINO、BEiT、MAE 等推动无标签数据训练,提升通用性。 - **3.2 开放词表视觉模型**(2021–2026):CLIP、ALIGN 等实现图文对齐,支持零样本识别。 - **3.3 可提示视觉基础模型**(2023–2026):SAM、SAM2、SAM3 等实现基于提示的分割与检测,支持开放任务。 ### 4. **视觉与语言任务的发展对比** - **架构跃迁**:ViT 确立图像 token 化,与语言模型的 token 化方式一致。 - **规模跃迁**:通过大规模预训练,如 ViT 的数亿图像、CLIP 的 4 亿图文对,验证了 Transformer 的规模化潜力。 - **对齐跃迁**:主要通过图文对齐实现,依赖语言模型。 - **推理跃迁**:尚未在视觉领域展现,仍处于探索阶段。 ### 5. **视觉 Transformer 的角色定位** - Transformer 在视觉任务中更多作为**骨干网络组件**,而非“核心本体”。 - 与语言任务不同,视觉数据是二维网格,需通过位置编码、窗口注意力等方式补足空间结构。 - 多模态任务中,Transformer 作为视觉编码器,被语言中枢接入,实现视觉与语言的对齐。 --- ## 技术演进时间轴 - **2017–2019**:注意力机制作为 CNN 增强模块,用于建模长距离依赖。 - **2020**:ViT 确立图像 token 化范式,纯 Transformer 可胜任图像分类。 - **2020–2021**:DETR、SETR 改写检测与分割输出范式,实现端到端处理。 - **2021**:Swin、PVT 等形成通用骨干,支持多尺度任务。 - **2022**:ConvNeXt 将 ViT 训练经验反哺 CNN,推动融合再平衡。 - **2021–2023**:DINOv2、CLIP、SAM 等推动自监督、图文对齐与可提示分割。 - **2025**:DINOv3、SAM3 进一步扩展预训练规模与提示能力。 --- ## 风险提示 - **技术迭代不及预期**:Transformer 在视觉任务中的进展可能低于预期。 - **大模型厂商 ARR 增速放缓**:模型厂商收入增长可能受限。 - **云服务商资本开支不及预期**:AI 算力需求可能未达预期,影响云服务投入。 - **智能驾驶及机器人商业化落地不及预期**:产品可靠性、成本或用户需求可能不足。 --- ## 结论 视觉 Transformer 的发展并非对 CNN 的彻底替代,而是**融合与再平衡**的过程。其演进路径体现了对视觉任务特点的适应与改进,最终目标是构建**可预训练、可迁移、可提示、可与语言对齐**的视觉基础模型。尽管在感知能力上取得突破,但视觉智能尚未形成如语言模型那样的“交互式”应用入口,仍需进一步探索。