深度报告-20260430-东吴证券-计算机行业深度报告_国产化训练从0到1里程碑_战略意义大于性能意义_18页_1mb
报告摘要
计算机行业深度报告总结
核心内容
DeepSeek V4是国产大模型在训练侧实现国产算力适配的重要里程碑,标志着国产算力在大模型训练环节的突破。其战略意义远大于性能意义,为国产算力生态的构建与商业化落地奠定了基础。
主要观点
- 国产算力适配:DeepSeek V4首次实现训练侧的国产算力适配,突破了以往国产算力仅用于推理侧的限制。
- 技术突破:通过三大核心技术设计(MXFP4量化感知训练、TileLang领域专用语言、自研MegaMoE2融合内核)解决了国产硬件在大模型训练中的通信瓶颈与性能限制。
- 性能表现:在知识储备、推理与代码能力、Agent能力、长上下文能力、中文创作能力等多个维度,DeepSeek V4表现优异,部分指标超越国际顶级闭源模型。
- 商用潜力:模型具备百万级上下文支持,推理效率与成本显著降低,具备广泛的商用前景。
- 投资建议:DeepSeek V4的发布标志着国产算力训练的初步成功,对国产算力产业链具有重要意义,相关标的包括寒武纪-U、海光信息、中科曙光等。
关键信息
技术创新
-
MXFP4量化感知训练:
- 采用微缩放4位浮点数格式,实现对MoE专家权重量化与CSA索引器QK路径的FP4精度执行。
- 降低显存占用与计算量,提升国产算力适配性。
- 未来可基于MXFP4设计专属加速单元,提升效率。
-
TileLang领域专用语言:
- 脱离CUDA生态,实现跨平台编译与优化。
- 提升开发效率与运行性能,降低迁移成本。
- 保障数值一致性,实现训练与推理的硬件解耦。
-
自研MegaMoE2融合内核:
- 实现专家并行的细粒度通信-计算重叠,解决通信瓶颈。
- 在华为昇腾平台完成适配,推理速度提升显著。
性能表现
-
知识储备:
- DeepSeek-V4-Pro-Max在SimpleQA-Verified上取得57.9分,中文SimpleQA得分84.4,接近Gemini-3.1-Pro。
- 在MMLU-Pro、GPQA Diamond等基准上均领跑开源赛道。
-
推理与代码能力:
- Codeforces评分达3206,位列人类选手排行榜第23名。
- LiveCodeBench Pass@1达93.5,IMOAnswerBench得分89.8,接近GPT-5.4。
-
Agent能力:
- SWE-bench Verified任务解决分数达80.6,与Claude Opus 4.6持平。
- Terminal Bench 2.0、MCPAtlas Public等基准均处于开源第一梯队。
-
长上下文能力:
- 支持1M token上下文,MRCR、CorpusQA等基准得分超越Gemini-3.1-Pro。
- 长程任务中保持高信息留存能力,实现任务闭环。
-
中文创作能力:
- 功能性写作对Gemini-3.1-Pro胜率达62.7%,创意写作胜率高达77.5%。
- 仅在高难度多轮约束场景下略逊于Claude Opus 4.5。
技术架构创新
-
CSA+HCA混合注意力架构:
- 将注意力复杂度从O(n²)降至O(n),显著降低计算成本。
- CSA通过压缩与稀疏选择,HCA通过极致压缩与稠密计算,实现全局与局部建模平衡。
-
mHC流形约束超连接:
- 升级残差结构,解决深层模型训练中的Loss Spike问题。
- 保证信号传播稳定性,支持万亿参数模型的训练。
-
创新后训练范式:
- 领域专家独立训练与全词表在线蒸馏结合,提升多领域能力融合效果。
投资建议
- 战略意义:DeepSeek V4的发布标志着国产算力在大模型训练环节的突破,对国产算力生态具有深远影响。
- 相关标的:
- CPU产业链:禾盛新材
- 国产AI芯片与算力基础设施:寒武纪-U、海光信息、中科曙光
- 国产GPU新锐厂商:摩尔线程-U、沐曦股份-U
- 算力硬件上游供应链:华丰科技、航天电器
风险提示
- 大模型迭代不及预期:技术更新速度可能影响模型竞争力。
- 国产算力适配进度不及预期:硬件与软件生态成熟度不足可能影响商业化进程。
- 市场竞争加剧:国内外大模型厂商竞争激烈,可能影响盈利空间。
- 政策监管趋严:数据安全、内容合规等政策风险可能限制技术发展。
附录:图表目录
- 图1:DeepSeek V4 Flash由昇腾参与训练,Pro正在进行国产算力训练适配
- 图2:DeepSeek V4-Pro Max 与主要竞争对手指标对比
- 图3:DeepSeek V4与其他模型各项评分详细对比
- 图4:DeepSeek V4系列内部指标横比
- 图5:DeepSeek V4与V3.2的计算量对比
- 图6:DeepSeek V4与V3.2的显存容量对比
- 图7:DeepSeek V4架构图,保留Transformer与MTP模块
- 图8:CSA核心架构图,展示KV压缩与DSA加速机制
- 图9:DeepSeek V4价格表,Flash版本成本显著低于Pro版本,后续有望进一步下降
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载