DeepSeek-R1Kimi_1.5及类强推理模型开发解读报告-北京大学-2025_76页_9mb
报告摘要
DeepSeek-R1展示了纯强化学习驱动的强推理模型新范式,跳过了监督微调(SFT)阶段,直接从基础模型通过大规模RL训练提升推理能力。这得益于高质量基座模型如DeepSeek-V3 Base,其参数规模超过671B,在14.8T高质量Token上训练,确保了初始能力基础。训练过程采用四阶段迭代:SFT→RL→再次SFT→再次RL,结合GRPO算法优化了RL训练,降低了计算成本,并通过基于规则的奖励机制(准确率奖励和格式奖励)实现自动化验证,避免了奖励黑客问题,同时自然涌现了长推理路径、推理链条的自我反思和排序能力。
在性能方面,DeepSeek-R1在数学(如AIME 2024得分79.8%、MATH-500得分97.3%)、代码(Codeforces Elo 2029,优于96.3%人类)和STEM问答任务中表现卓越,甚至超越闭源模型如OpenAI o1系列,标志着开源强推理模型的重要突破。模型通过纯RL实现了“自验证”和“反思”,例如在推理过程中展现出验证、回溯和总结行为,提升了答案准确性和可读性。
与Kimi K1.5对比,两者都依赖RL扩展推理能力,但DeepSeek-R1更注重纯RL从头训练,而Kimi K1.5采用In-Context RL和长文本CoT指导短文本推理。总体而言,RL添加了时间维度的扩展,但需处理冷启动稳定性、奖励建模和安全性的挑战。
未来方向包括多模态扩展、AI Agent赋能和形式化验证,以应对逆向对齐问题和确保模型可靠性。强化学习技术将推广到更多领域,结合蒸馏优化小模型表现,并探索跨模态对齐机制。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载