20260722-海通国际-Google_Frozen_V2_模型与芯片协同进一步深化_推理竞争转向_Token_W_4页_341kb
报告摘要
Google Frozen V2 总结
核心内容
Google 正在研发一款名为 Frozen V2 的新型服务器AI芯片,该芯片旨在进一步深化模型与芯片的协同,通过将Gemini模型中的稳定结构和执行路径硬件化,以提升推理效率。Frozen V2 不是取代现有TPU芯片,而是作为其补充,目标是显著提升单位功耗下的Token产能,预计可达Google最新自研AI芯片的6-10倍。
主要观点
- 模型专用化趋势:Frozen V2 是Google首次围绕具体模型(Gemini)设计的芯片,标志着其从通用计算向模型专用化方向的转变。
- 效率提升来源:通过减少通用指令、运行时调度和数据搬运,提升Token/W(Token/瓦特)效率,优化计算资源利用率。
- 解决“内存墙”问题:Google认为,当前推理性能受限于内存访问瓶颈,Frozen V2通过硬件化模型结构,进一步压缩内存访问需求,提高吞吐效率。
- 内部流量驱动:Google依托其庞大的Gemini模型流量和自研芯片供应链,为Frozen V2提供了实现基础,而非单纯依赖外部市场。
- 对标NVIDIA异构推理方案:Frozen V2与NVIDIA的“Rubin GPU + Groq 3 LPX”方案在提升Token/W方面目标一致,但Google更强调内部软硬件闭环优化。
关键信息
技术特点
- 硬件固化范围:将Gemini中较稳定、重复率高的模型结构和执行逻辑硬件化,保留部分软件层的更新能力。
- 架构设计:仍在设计阶段,最终代工、设计服务和封装合作方尚未披露。
- 功耗与性能:预计Token/W提升6-10倍,可大幅降低推理集群的功耗需求。
- 芯片规模与制程:若于2028年前后量产,将依赖先进制程、HBM和2.5D封装技术。
经济价值
- 功耗降低:在服务相同Token需求时,功耗理论上可下降约83%-90%。
- 成本节省:若在100MW IT负载的推理集群中应用,可节省约2,150万-2,320万美元年电费。
- Capex延期:减少对数据中心扩建的需求,提升资本效率。
战略意义
- 内部资源优化:Frozen V2有助于缓解Google内部AI计算资源紧张,改善Gemini API、搜索AI摘要和Agent服务的毛利率。
- 市场定位:定位为TPU的补充,而非替代,短期内仍需依赖GPU和TPU的协同使用。
- 中长期影响:若成功,可能促使头部模型厂商将稳定推理流量迁移至自研ASIC,对NVIDIA在Decode市场的份额形成分流。
风险提示
- 市场竞争加剧:随着更多厂商进入模型专用芯片领域,市场竞争将更加激烈。
- 技术验证不及预期:硬件固化可能面临技术瓶颈,无法达到预期性能。
- 产品落地不及预期:从设计到量产存在不确定性,可能影响项目推进。
项目背景
- TPU发展现状:Google TPU已升级至N3E/N3P,采用CoWoS-S封装,提升性能与能效。
- 内部生态优势:Google拥有Gemini模型、TPU、ICI互联、编译器等内部资源,为其定制化芯片开发提供基础。
- 外部合作扩展:新一代TPU项目已引入MediaTek等新合作伙伴,显示Google在芯片供应链上的扩展。
总结
Frozen V2 是Google在AI芯片领域的一次重要尝试,标志着其从通用计算向模型专用化迈进。通过将Gemini模型的稳定部分硬件化,Google旨在提升推理效率,降低功耗,优化内部资源分配。尽管短期内仍需依赖TPU和GPU,但中长期来看,Frozen V2可能对NVIDIA在Decode市场的优势构成挑战,推动行业向更深层次的软硬件协同发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载