> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容概述 本报告聚焦于人工智能在视觉任务中的应用,重点分析了卷积神经网络(CNN)与视觉Transformer(ViT)两类视觉骨干网络的差异及其在实际应用中的表现与发展趋势。报告指出,CNN与ViT分别代表了“强先验”与“弱先验”的两种设计哲学,其竞争本质上是视觉规律在结构先验、数据规模和算力之间的分工与平衡。随着技术演进,两者正逐步融合,进入“视觉架构融合时代”。 ## 主要观点与关键信息 ### 1. 视觉骨干网络的作用 - 视觉骨干网络是机器视觉系统中将原始像素转化为高层语义特征的核心模块。 - 主要任务包括图像分类、目标检测、语义分割与实例分割,通常采用“骨干网络+任务头”的范式。 - 骨干网络的表征质量直接影响下游任务的性能上限。 ### 2. 视觉架构的演进阶段 - **手工特征时代**(2012年前):依赖人工设计的特征算子如 SIFT、HOG,配合 SVM 等分类器。 - **CNN 崛起**(2012—2020):通过深度网络自动学习局部特征,形成视觉骨干的产业基础。 - **ViT 登场**(2020—2022):引入自注意力机制,实现全局关系建模,依赖大规模数据预训练。 - **融合时代**(2022至今):CNN 与 ViT 相互借鉴,形成局部性与全局注意力融合的新架构。 ### 3. CNN 与 ViT 的核心差异 | 对比维度 | CNN | ViT | |----------|-----|-----| | 感受野 | 逐层扩大,深层才全局 | 第一层即全局交互 | | 归纳偏置 | 强先验:局部连接、权值共享、平移等变性 | 弱先验,依赖数据与算力 | | 数据效率 | 小数据集表现更好,样本效率高 | 需要大规模数据,性能提升空间大 | | 计算复杂度 | 随分辨率线性增长,硬件友好 | 自注意力随分辨率平方增长,算力需求高 | | 长程依赖 | 需堆叠深度,相对困难 | 天然擅长 | | 部署成熟度 | 端侧工具链成熟,适合实时与低功耗场景 | 部署生态仍在完善,适合云端与研究前沿 | ### 4. 技术路线之争 - **CNN 优势**:在中小数据集、端侧部署和实时任务中表现稳定,具有较高的数据效率和部署成熟度。 - **ViT 优势**:在大规模数据和算力支持下,具有更强的扩展性和全局建模能力,适合多模态大模型和研究前沿。 - **融合趋势**:Swin、CoAtNet、ConvNeXt 等架构尝试在保留结构先验的同时增强数据学习能力,推动视觉骨干向动态平衡发展。 ### 5. 产业落地现状 - **研究前沿**:多采用 ViT 或类 Transformer 架构,如 CLIP、SigLIP、Qwen-VL。 - **车端量产**:受算力、时延和安全限制,倾向于使用 CNN 前端与 Transformer 融合的混合架构。 - **未来趋势**:随着技术进步,混合架构可能成为主流,兼顾结构先验与数据学习。 ### 6. 数字 AI 与物理 AI 的发展路径 - 数字 AI 底座模型发展路径逐渐清晰,但难以实现物理世界的闭环建模。 - 物理 AI 被认为是更具增量潜力的方向,尤其在智能驾驶等场景中,已有初步落地验证。 ### 7. 风险提示 - 技术迭代不及预期; - 大模型厂商 ARR 增速放缓; - 云服务商资本开支不及预期; - 智能驾驶及机器人商业化落地不及预期。 ## 总结 CNN 与 ViT 代表了视觉架构的两种范式,其差异体现在结构先验、数据依赖、计算复杂度与部署场景等方面。当前,两者正进入融合阶段,各自优势在不同任务和场景中体现。研究前沿偏向 ViT,而车端量产则更依赖混合架构。随着物理 AI 的发展,智能驾驶作为最先实现闭环的代表场景,值得关注。