DeepSeek核心十问十答_27页_3mb
报告摘要
DeepSeek 核心十问十答总结
核心观点
DeepSeek-R1 模型发布,具有高性能和低算力需求的特性,带动了小模型推理能力的提升,引发全球开发者和用户关注。R1 作为开源模型,其性能接近头部闭源模型 o1,标志着 AI 平权的实现。同时,纯强化学习(RL)对推理能力的提升,展示了 RL 范式泛化的潜力,预计后续基模的持续迭代将推动 AI 全产业链持续保持高景气和高关注度。投资建议包括关注算力、应用、端侧和数据等环节。
行业动态信息
1.1 DeepSeek 用户量趋势
- DeepSeek 坚持开源路线,密集更新 MoE、推理和多模态模型。
- 用户数增长迅速,春节信息传播下沉促进了产品关注度裂变。
- DeepSeek 在发布第 5 天就超越 ChatGPT,第 15 天达到其 2 倍日活,第 18 天达到 1500 万日活,成为全球增速最快的 AI 原生应用。
1.2 R1 和 Janus-Pro 模型性能
-
R1 模型:
- 在推理任务上基本实现与 OpenAI-o1 相当的性能,优于 o3。
- 在多个基准测试中表现优异,如 MMLU、GPQA Diamond、SimpleQA、Codeforces、SWE-bench 等。
- 通过蒸馏技术,显著提升了小模型的推理能力,如 R1-7B、R1-14B 等。
-
Janus-Pro 模型:
- 在多模态理解和生成方面表现优异,优于统一模型和单一功能模型。
- 在 MMBench、GeneEval、DPG-Bench 等测试中取得总体最佳结果。
- 采用独立的视觉编码路径,缓解了多模态理解和生成任务的冲突。
1.3 DeepSeek-V3 训练成本
- DeepSeek-V3 训练成本仅为 OpenAI 同类模型的数十分之一。
- API 服务价格远低于 OpenAI,例如输入 tokens 0.1 美元/百万(缓存命中)。
- 通过 MLA、MoE 架构、Dual Pipe 框架、FP8 数据格式等技术优化,实现成本大幅下降。
技术革新
2.1 DeepSeek-V3/R1 技术革新
- 多头潜在注意力(MLA):减少键值缓存需求,提升模型效率。
- DeepSeekMoE:使用更细粒度专家模型,优化计算资源利用率。
- 多 token 预测(MTP):提升训练和推理性能,保持完整的因果链。
- Dual Pipe 框架:提高通信效率,加速模型训练。
- FP8 混合精度框架:减少计算冗余,提升推理速度。
- 强化学习(RL):R1-Zero 模型通过纯 RL 训练获得推理能力,R1 通过多阶段训练提升性能。
- 组相对策略优化算法(GRPO):无需判别器,实现模型“反思”能力,提升推理深度。
2.2 Janus 系列模型技术革新
- 解耦视觉编码路径:缓解多模态理解和生成任务的冲突。
- 多模态生成模型架构:包括自回归、扩散模型、掩码自回归等,持续优化模型能力。
- 合成数据应用:丰富数据集,提升模型表现。
2.3 DeepSeek 数据集特点
- 合成数据在大模型训练中起重要作用,提升数据质量和模型性能。
- DeepSeek 通过合成数据强化推理和生成能力,如 R1-Zero 生成数据用于微调。
2.4 Scaling Law 有效性
- 训练侧 Scaling Law:受技术、算力、数据限制,面临瓶颈。
- 推理侧 Scaling Law:通过强化学习、思维链等方式提升模型性能。
- 三种路径:
- Pre-Training Scaling:训练数据、模型规模、计算资源提升带来性能增长。
- Post-Training Scaling:强化学习和人类反馈优化模型表现。
- Test-Time Scaling:通过思维链等技术,提升推理深度。
投资建议
- 算力:关注国产算力和 AI 推理需求,推荐海光信息、浪潮信息、软通动力,关注并行科技、宝信软件等。
- 应用:
- B 端:金蝶国际、鼎捷数智、赛意信息、用友网络、恒生电子、中控技术。
- C 端:金山办公、万兴科技、彩讯股份、同花顺。
- 端侧:
- 教育:视源股份、科大讯飞。
- 新终端:虹软科技、联想集团。
- 数据:关注向量数据库、数据处理类企业,如拓尔思。
风险分析
- 技术瓶颈:训练侧 Scaling Law 受到技术、算力和数据的制约。
- 算力成本:随着模型规模扩大,算力需求可能显著增加。
- 数据质量:高质量数据缺失,合成数据技术仍待突破。
- 安全与隐私:R1 的开源引发对安全和隐私的担忧,可能影响其商业化进程。
AI 平权与产业链影响
-
R1 与 AI 平权:
- R1 作为开源模型,性能接近头部闭源模型 o1,体现了 AI 平权。
- 通过 RL 技术,小模型具备推理能力,降低开发者成本,促进 AI 实际落地。
- R1 开源引发全球复现热潮,推动 AI 技术的开放发展。
-
DeepSeek 出圈影响:
- DeepSeek 以低成本、高性能全面影响 AI 产业链。
- 算力、模型、应用等各环节均受到冲击,推动行业快速发展。
- 引发 OpenAI 等大厂调整策略,如 Sam Altman 承认开源策略的错误,并开始讨论部分模型开源。
结论
DeepSeek-R1 和 Janus-Pro 等模型的发布,标志着 AI 技术的持续革新和开源趋势的增强。通过 MLA、MoE、强化学习等技术,DeepSeek 实现了模型性能的显著提升和成本的大幅降低。同时,R1 的开源和蒸馏技术,使小模型具备推理能力,推动了 AI 平权和产业链的全面发展。未来,随着技术迭代和算力提升,AI 行业将持续保持高景气,投资机会将集中在算力、应用、端侧和数据等核心环节。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载