> **来源:[研报客](https://pc.yanbaoke.cn)** # 文档总结 ## 核心内容 文档主要分析了AI推理需求的增长趋势、模型供给格局、CSP(云服务提供商)的产业价值以及未来AI应用的发展方向。通过OpenRouter平台的数据,揭示了推理需求由简单聊天向复杂工作流迁移的趋势,并指出中国模型正在成为全球开发者的重要力量。 ## 主要观点 ### 1. 推理需求进入高速扩张期 - 推理需求的增长动力正由简单聊天向复杂工作流迁移。 - OpenRouter作为中立型API聚合平台,其流量虽不能直接代表全球大模型需求,但可作为观察开发者推理活动的重要窗口。 - 2025年1月至2026年7月,平台月度日均Token由0.072T增长至7.995T,19个月内增长约111倍。 - 2026年7月单日Token峰值达到9.622T,表明推理需求呈现加速增长趋势。 ### 2. 模型供给进入百花齐放阶段,但流量仍集中于头部 - OpenRouter平台目前包含337个模型和58家厂商,其中271个支持工具调用,212个支持推理参数,92个支持百万级上下文。 - 前十大模型占据约62.2%的Token份额,头部模型仍获得大部分流量。 - 模型竞争的关键已从能否上架转向性价比、推理速度、服务稳定性及能否进入高频工作流。 - 中国模型凭借快速迭代能力和成本优势,月度Token份额由2025年1月的6.0%提升至2026年7月的61.5%。 - 最新前十大模型中有7个来自中国厂商,表明中国模型已成为开发者的主要选择。 ### 3. CSP(云服务提供商)的产业价值持续提升 - 当模型迭代周期短于企业硬件采购周期时,CSP通过共享资源池、多模型接入、弹性部署、统一计费等能力,能够有效承接波动性需求。 - 海外主要云服务厂商包括AWS、Microsoft Azure、Google Cloud和Oracle OCI,国内则有阿里云、腾讯云等具备规模、生态和客户优势的厂商。 - Token增长并不必然等同于云厂商利润增长,其价值兑现取决于AI云收入增速、GPU利用率、推理价格竞争、资本开支与折旧压力。 - 具备资源规模、全栈平台能力和企业客户基础的厂商更可能受益。 ### 4. 成本下降释放AI应用需求弹性 - 模型能力提升、推理价格下降及多模型API接入门槛降低,显著降低了AI应用的开发与部署成本。 - Agent/Coding类应用仅占应用数量的19%,却贡献了81.2%的Token,表明其是当前推理需求的核心来源。 - 头部应用每请求Token约为其他应用的2.7倍,说明复杂任务和专业工作流对Token消耗更大。 - 建议B端关注Coding Agent、通用任务型Agent及工业、医疗、金融、法律、设计等高价值垂直场景;C端则关注具备IP/版权资源、内容生产场景、流量入口、算力优化及运营能力的公司。 ## 关键信息 ### 1. OpenRouter平台增长特征 - **Token增长**:平台日均Token在19个月内增长约111倍,2026年7月单日峰值达到9.622T。 - **增长动力**:增长并非平滑线性,而是由新模型上线、免费版本放量和开发者工作流迁移共同驱动。 - **关键增量阶段**: - 2025-09:Grok Code Fast、Grok 4 Fast免费版、DeepSeek V3.1免费版。 - 2026-02:MiniMax M2.5、Kimi K2.5、GLM-5。 - 2026-03:小米MiMo V2 Pro、Step 3.5 Flash免费版、Claude 4.6 Sonnet。 - 2026-06:MiniMax M3、小米MiMo V2.5、DeepSeek V4 Flash。 - 2026-07:腾讯HY3免费版、小米MiMo V2.5、GLM-5.2。 ### 2. 模型能力与流量分布 - **工具调用支持率**:80.4%的模型支持工具调用,说明该能力已成为主流开发者工作流的基础门槛。 - **推理参数支持率**:支持推理参数的模型占目录供给的62.9%,但在日榜模型中占93.9%,获得98.8%的Token。 - **百万级上下文支持率**:占目录的27.3%,但在日榜模型中占57.1%,Token权重达73.8%。 - **中国模型优势**:中国付费头部模型输入价格中位数为0.20美元/百万Token,海外为0.50美元,低约60%。 ### 3. 应用生态趋势 - **应用层集中度**:应用层HHI达到1,850,明显高于模型层的574,表明应用层流量更集中。 - **头部应用**:前六大应用均为Agent或Coding工具,Hermes Agent以39.7%的Token份额领先。 - **应用类型**:应用需求正在形成三类典型形态: - 高规模、高强度:Hermes Agent占21.4%的请求量,每请求消耗约8.3万Token。 - 重度工作流:Hello Minds、Cursor、Cline等应用每请求消耗17.2万、11.3万、10.5万Token。 - 高频轻量交互:Janitor AI占4.2%的请求量,但每请求仅约1.4万Token。 ## 风险提示 - 技术进步低于预期 - 商业化低于预期 - 政策风险 - 经营管理风险 ## 地址信息 - **深圳**:深圳市福田区福华一路125号国信金融大厦36层,邮编:518046,总机:0755-82130833 - **上海**:上海浦东民生路1199弄证大五道口广场1号楼12楼,邮编:200135 - **北京**:北京西城区金融大街兴盛街6号国信证券9层,邮编:100032