【InfoQ研究中心】2025年DeepSeekAI赛道的超级引擎AI前线特刊_159页_12mb
报告摘要
DeepSeek: AI赛道的超级引擎总结
核心内容
DeepSeek 是一家在人工智能领域取得重大突破的公司,其技术路线和创新实践正在引领AI行业的发展方向。DeepSeek 通过一系列技术革新,如纯强化学习、MoE架构、多头潜在注意力机制(MLA)等,实现了大模型在性能和成本上的双重突破。其推出的 R1 模型更是被视为“游戏规则改变者”,在推理能力上实现了与 OpenAI 的 o1 模型相当甚至更优的成果,同时保持了开源的开放性。
主要观点
- 技术突破:DeepSeek 通过纯强化学习训练模型,成功地在没有过程监督的情况下实现了复杂推理能力,这标志着推理模型训练方法的重大转变。
- 成本优势:DeepSeek 的 V3 模型训练成本仅为 LLaMA 3.1 的十分之一,其 MoE 架构和稀疏激活机制显著降低了算力需求,提升了模型效率。
- 开源生态:DeepSeek 一直坚持开源策略,不仅发布了多个版本模型,还开放了模型中间层接口,降低了开发者的使用门槛,推动了产业生态的创新。
- 商业化潜力:DeepSeek 通过技术创新和开放协作,正在重塑 AI 商业化格局。其模型在多个领域(如金融、教育、医疗)展示了强大的应用前景。
- 全球化发展:DeepSeek 的模型目前主要支持中英文,未来将扩展至更多语言,以适应全球化需求。
- 人才战略:DeepSeek 注重人才的“推重比”,即在技术与商业思维之间找到平衡,构建了“双轨道”人才培养体系,提升了团队的整体竞争力。
关键信息
技术创新
- DeepSeek V2:提出了 MLA 机制和 DeepSeek MoE 架构,显著降低了训练成本和显存需求。
- DeepSeek V3:拥有 6711 亿参数,但推理时仅激活 370 亿参数,成本仅为 LLaMA 3.1 的十分之一。
- DeepSeek R1:基于强化学习训练,无需监督微调,直接在 V3 基础模型上进行优化,性能接近甚至超越 GPT-4o,成为推理大模型的代表。
模型性能对比
| 模型 | 总分 | 中文推理 | 中文语言 | 数学 | 代码 | 多语言 |
|---|---|---|---|---|---|---|
| GPT-4-1106-Preview | 8.01 | 7.73 | 8.29 | 7.80 | 7.66 | 8.61 |
| DeepSeek-V2 Chat (RL) | 7.91 | 7.45 | 8.36 | 7.77 | 7.14 | 8.37 |
| DeepSeek-V2 Chat (SFT) | 7.74 | 7.30 | 8.17 | 7.34 | 7.26 | 8.13 |
| GPT-40613 | 7.53 | 7.47 | 7.59 | 7.56 | 7.37 | 7.42 |
| DeepSeek-67B-Chat | 6.43 | 5.75 | 7.11 | 5.71 | 5.79 | 7.58 |
成本对比
| 模型 | 参数规模 | 训练成本 (GPU hours) |
|---|---|---|
| Llama 3.1 8B | 8B | 1.46M |
| Llama 3.1 70B | 70B | 7.0M |
| Llama 3.1 405B | 405B | 30.84M |
| DeepSeek V3 | 671B | 2.788M |
R1 模型的训练方法
-
第一阶段:R1 Zero 强化学习训练
- 无需监督微调,直接使用强化学习。
- 引入格式奖励,确保输出包含中间思考过程和最终答案。
- 使用 GRPO(Group Relative Policy Optimization)算法,优化策略。
-
第二阶段:冷启动数据与推理能力增强
- 利用 R1 Zero 生成的冷启动数据对 V3 模型进行微调。
- 引入语言一致性奖励,减少多语言混合问题。
-
第三阶段:最终 R1 模型训练
- 结合监督微调和强化学习,生成高质量的推理数据。
- 通过结果监督信号训练出“慢思考”能力,提升模型在复杂任务中的表现。
蒸馏模型
- DeepSeek 使用 R1 生成的推理数据对其他模型(如 Llama、Qwen)进行蒸馏训练,显著提升了其性能。
- 蒸馏后的模型在多个任务上表现优异,接近或超过闭源模型水平。
技术局限与挑战
| 类别 | 局限与挑战 | 详细描述 |
|---|---|---|
| 通用能力不足 | 在函数调用、多轮对话等任务上表现不如 V3 | 需要更强的上下文理解和结构化输出能力 |
| 语言混合问题 | 主要针对中英文优化,处理其他语言时可能出现混合 | 需要更广泛的数据和复杂的对齐机制 |
| 提示词敏感性 | 对提示词较为敏感,少样本提示会显著降低性能 | 需要更鲁棒的提示词工程方法 |
| 推理能力蒸馏 | 小模型通过蒸馏继承推理能力的潜力尚未完全挖掘 | 需要进一步探索如何结合 RL 训练 |
| 安全性与无害性 | 在复杂推理任务中,模型可能生成有害或误导性内容 | 需要引入更细粒度的安全奖励模型 |
未来展望
- 中美大模型竞争:尽管竞争激烈,但全球合作趋势正在形成,尤其是在开源和技术创新方面。
- AI应用落地:DeepSeek 的成功表明,AI 正在从技术奇观走向产业基础设施,其技术突破和开源策略为各行业提供了新的可能性。
- AI能力边界:DeepSeek 通过技术革新,正在重新定义 AI 的能力边界,使其在多个领域具备广泛的落地应用前景。
总结
DeepSeek 通过纯强化学习、MoE 架构、开源生态和人才战略等多方面的创新,正在引领 AI 行业的变革。其技术突破不仅提升了模型的性能和效率,也推动了 AI 商业化的进程。未来,DeepSeek 有望在全球范围内进一步扩展其影响力,成为 AI 领域的重要力量。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载