2025-02-04-DeepSeek-DeepSeekV3技术报告_53页_5mb
报告摘要
DeepSeek-V3 技术报告总结报告总结
模型详情与创新架构
- 总参数671B,每个token激活37B参数
- 创新架构包括:多头潜在注意力(MLA)高效推理 + DeepSeekMoE经济型训练
- 采用无辅助损失的负载平衡策略,减少对模型性能的负面影响
- 引入多标记预测训练目标,提升模型性能和推测解码能力
训练与成本
- 支持FP8混合精度训练,在H800集群上训练
- 整体训练成本为5,576,000美元,GPU小时仅需2,788万
- 使用DualPipe算法实现高效率管道并行,结合计算与通信重叠策略
- 预训练使用14.8T多样化高质量token
评估结果
- 在十项主要基准测试中成为当前最强开源模型
- 与闭源模型如GPT-4o、Claude-3.5 Sonnet性能相当
- 在数学、代码和英语基准测试中有显著超越其他开源模型的结果
- 中文权威基准测试上领先竞争对手
后训练与优化
- 引入来自DeepSeek-R1的推理能力蒸馏
- 基于策略相对策略优化(GrPO)的强化学习
- 双向自反馈机制进一步提升模型能力
硬件建议
- 推动AI硬件专用化,卸载通信任务
- 建议提高GPU低精度计算精度
未来展望
- 支持更长上下文高效的推理
- 探索突破传统Transformer的架构
- 延伸数据维度并探索自适应训练策略
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载