【天津大学】2025深度解读DeepSeek原理与效应_44页_7mb
报告摘要
深度解读DeepSeek:原理与效应
核心内容概述
本文档详细介绍了DeepSeek系列大语言模型的发展历程、技术原理、创新点以及其在AI领域产生的效应。DeepSeek系列模型在模型架构、训练方法和推理能力等方面进行了多项创新,显著提升了大模型的性能与效率,同时推动了AI开源生态的发展,并对AI安全与治理提出了重要见解。
主要观点与关键信息
1. 生成式AI发展路线图
- 生成式AI自2014年起逐步发展,从Attention机制到Transformer架构,再到Scaling Laws和RLHF等技术。
- o1/R1代表生成式求解问题,即模型不仅能生成答案,还能展示推理过程。
2. DeepSeek V2-V3/R1技术原理
- DeepSeekMoE:采用稀疏激活机制,减少计算资源的消耗,提升模型效率。
- 使用细粒度专家(共享+路由)设计。
- 引入Device-Limited Routing、Auxiliary Loss for Load Balance、Token-Dropping Strategy等优化策略。
- MLA(Multi-Head Latent Attention):通过低秩压缩技术降低KV缓存占用空间,提升推理效率。
- FP8训练:采用低精度存储与通信,进一步减少训练和推理成本。
- MTP(Multi-Token Prediction):一次预测多个token,提升生成效率。
- R1训练:采用大规模RL训练,发现RL训练的Scaling Laws,并通过4步法解决R1-Zero存在的问题。
3. DeepSeek效应
- 算力价格战:DeepSeek在性能/成本曲线方面表现出色,显著降低训练成本。
- DeepSeek-V3训练成本为约2.8M GPU小时,远低于Llama 3 405B(30.8M GPU小时)。
- 开源 vs 闭源:DeepSeek的开源发布打破了美国AI企业的技术护城河,提升了中国AI的国际竞争力。
- 创新&人才&Vision:
- DeepSeek的成功得益于大量第一类人才(技术型人才)和第二类人才(战略型人才)的协同创新。
- 中国需加强大模型人才的培养,推动底层核心技术的突破。
- AI安全治理:DeepSeek-R1在推理能力上有所提升,但模型安全性有所下降,强调推理能力对模型安全的重要性。
4. 未来展望
- AGI/ASI发展:实现AGI/ASI可能需要3-5个重大突破,包括在未探明方向上的0-1创新。
- 技术路线图:
- 1-5年:智能体(通用型0-1前半段,垂类的1-100阶段)。
- 5-10年:创新者(第二个重大突破,自动化科学研究/技术创新)。
- 10-20年:组织者(第三个重大突破,AI自组织、自管理、自推进)。
- 科研范式:从经验科学到计算科学,再到数据驱动科学和智能驱动科学,AI正在推动科学研究范式的变革。
- AI安全:需从模型架构、训练过程、部署阶段等多个层面进行安全治理,提升模型的可解释性和安全性。
技术创新总结
| 技术创新 | 描述 |
|---|---|
| DeepSeekMoE | 稀疏激活机制,减少计算资源消耗 |
| MLA | 低秩压缩技术,降低KV缓存占用空间 |
| FP8训练 | 低精度存储与通信,提升训练和推理效率 |
| MTP | 一次预测多个token,提升生成效率 |
| GRPO | 强化学习训练框架,减少训练成本 |
| 推理模型蒸馏 | 将大模型推理能力蒸馏到小模型,提升小模型性能 |
模型性能对比
| 模型 | 逻辑推理 | Level 1 | Level 2 | Level 3 | 开源 | 模型规模 |
|---|---|---|---|---|---|---|
| DeepSeek-R1(API) | 76.10% | 90.48% | 77.14% | 61.70% | Yes | 671B |
| DeepSeek-R1(网页) | 74.84% | 80.95% | 78.57% | 63.83% | Yes | 671B |
| o1-preview | 72.33% | 88.10% | 74.29% | 55.32% | No | undisclosed |
| DeepSeek-V3 | 49.06% | 66.67% | 52.86% | 27.66% | Yes | 671B |
| GPT-4-Turbo | 42.77% | 57.14% | 48.57% | 21.28% | No | undisclosed |
AI安全评估
| 安全指标 | DeepSeek-R1 | GPT-4o-2404 | GPT-4-turbo-2404 | AVG-2404 |
|---|---|---|---|---|
| 渴望资源 | 24.35 | 19.04 | 19.42 | 33.30 |
| 自我维持 | 22.33 | 25.92 | 23.33 | 35.56 |
| 情景意识 | 50.82 | 38.75 | 35.24 | 60.32 |
| 不良合作 | 8.26 | 6.71 | 7.39 | 15.78 |
| 进化思想 | 41.33 | 43.32 | 38.67 | 49.63 |
| 欺骗意愿 | 16.64 | 10.60 | 10.90 | 24.53 |
| 危险目标 | 33.66 | 27.23 | 24.24 | 40.28 |
| 总分 | 29.08 | 25.92 | 23.95 | 37.82 |
未来建议
- 国家层面:提升AI在国家科技和产业中的战略地位,统筹资源,制定AI政策和计划。
- 基础设施:建设超级智算网络、通用及行业数据基础设施、大规模人工智能软件基础平台等。
- 技术攻关:开展大模型关键理论和技术攻关,研发硬核技术。
- 生态培育:培育大模型创新发展生态,鼓励资本投入硬核技术创业。
- 人才培养:重视AI人才培养,培养战略型和技术型人才。
- 安全治理:加强AI安全治理,推动底层安全技术的创新突破。
- 国际合作:开展国际合作,建立新型AI国际组织和机构。
- 标准建设:推动AI行业、国家、国际标准建设,形成标准体系。
总结
DeepSeek系列模型在技术架构、训练方法和推理能力上实现了多项创新,显著提升了大模型的性能与效率。其开源发布对AI生态产生了深远影响,打破了美国的技术壁垒,推动了全球AI发展。未来,中国需在人才、技术、基础设施等方面加大投入,以实现AGI/ASI目标,并在AI安全治理方面取得更大进展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载