【中信建投】计算机行业:DeepSeek+R1深度解析及算力影响几何
报告摘要
证券研究报告·行业动态研究总结
核心内容
本报告重点分析了DeepSeek R1、Kimi 1.5和Qwen2.5等国内大语言模型在深度推理能力方面的进展,以及它们在算力需求和性能表现上的创新。通过这些模型的发布,可以看出国内模型在深度推理任务上已取得显著成果,并在性能和成本上展现出竞争力。
主要观点
- DeepSeek R1 通过结合微调和强化学习,在多个推理任务上取得了与OpenAI o1-1217相当甚至更优的性能,特别是在数学、代码和自然语言推理任务上表现突出。
- Kimi 1.5 作为一款多模态模型,它在短链(Short-CoT)和长链(Long-CoT)推理任务中均表现出色,尤其是其Partial Rollout框架和Long2Short RL技术,使模型在有限算力下也能实现高效推理。
- Qwen2.5 系列模型在性能上进一步提升,尤其是在编程和数学任务中,其专门优化的模型(如Qwen2.5-Coder和Qwen2.5-Math)显著增强了相关能力。此外,Qwen2.5-1M和Qwen2.5-VL等新版本在处理长文本和视觉任务方面也表现出色。
- 算力优化 是这些模型取得高性能的关键,DeepSeek R1通过算法、框架和硬件的协同优化,实现了低算力需求下的高性能表现。而Kimi 1.5和Qwen2.5则通过创新的训练方法和数据处理策略,进一步降低训练和推理成本。
关键信息
DeepSeek R1
- R1-Zero 仅通过强化学习训练,其在AIME 2024任务上的pass@1指标提升至71.0%,通过投票策略后提升至86.7%,与OpenAI o1-0912相当。
- R1 通过两次微调和两次强化学习,解决了R1-Zero的可读性和语言混合问题,其在AIME 2024、MATH-500和Codeforces等任务上表现优异。
- 算力优化:采用专家混合模型、多头隐式注意力、多token预测、FP8混合精度训练、流水线并行策略、高效跨节点通信等技术,实现低算力需求下的高性能表现。
- 蒸馏效果:R1的推理能力可以蒸馏到更小的模型中,显著提升了小模型的推理性能,成本仅为OpenAI o1模型的几十分之一。
Kimi 1.5
- 创新点:引入了Partial Rollout和Long2Short RL,使得模型在短链推理任务中表现突出,同时具备多模态处理能力。
- 性能表现:在short-CoT模式下,Kimi 1.5的数学、代码、视觉多模态和通用能力大幅超越GPT-4o和Claude 3.5,领先幅度达到550%。
- 算力优化:采用长上下文扩展、改进的策略优化、简化的RL框架,提升了模型的推理效率和能力。
Qwen2.5
- 模型系列:包括0.5B、1.5B、3B、7B、14B、32B、72B等多个版本,以及专门的编程和数学模型Qwen2.5-Coder和Qwen2.5-Math。
- 预训练数据:使用了18T tokens的高质量数据集,相较于Qwen2的7T tokens,数据量显著增加。
- 训练优化:采用两阶段强化学习(离线RL和在线RL),并引入了多领域监督微调数据,提升了模型在不同任务上的表现。
- 性能表现:在多个基准测试中,如MMLU、MMLU-Pro、LiveCodeBench、Arena-Hard等,Qwen2.5均表现优异,其中Qwen2.5-Max全面超越DeepSeek V3。
- 视觉模型:Qwen2.5-VL在视觉理解任务上表现卓越,全面超越GPT-4o和Claude3.5。
算力影响分析
- 算力需求:虽然当前模型在训练和推理阶段的算力需求有所下降,但随着深度推理的普及,模型的算力需求仍然会呈现爆发式上涨。
- 长期算力增长逻辑:即使在当前阶段,算力的优化和协同应用并未削弱其在人工智能模型发展中的重要性。算力仍然是推动模型性能提升的关键因素。
风险提示
- 大模型技术发展不及预期
- 商业化落地不及预期
- 政策监管力度不及预期
- 数据数量与数据质量不及预期
问答案例对比
开关控制灯泡问题
- DeepSeek R1:通过控制开关状态和观察灯泡的亮灭及温度,准确判断开关与灯泡的对应关系。
- Kimi 1.5:在短链推理模式下,通过逻辑推理和策略优化,得出合理的结论。
- Qwen2.5:采用保守策略,确保不成为最大或最小的抓豆子者,从而保命。
囚犯抓豆子博弈
- DeepSeek R1:通过逆向推理,得出2、3、4号囚犯存活,1号和5号被处死的结论。
- Kimi 1.5:在缺乏交流的情况下,通过逻辑推理和策略分析,推测最终存活人数。
- Qwen2.5:基于策略和观察,推测囚犯的抓豆子行为,并预测最终结果。
总结
DeepSeek R1、Kimi 1.5和Qwen2.5等模型的发布,标志着国内大语言模型在深度推理能力上的显著进步。通过强化学习、多token预测、FP8混合精度训练、流水线并行策略等技术,这些模型在性能和成本方面展现出优势。尽管算力需求在当前阶段有所下降,但随着深度推理的深入发展,算力需求仍将持续增长,这将对算力行业提出更高要求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载