DeepSeek-R1+Incentivizing+Reasoning+Capability+in+LLMs+viaReinforcement+Learning_22页_1mb
报告摘要
总结:DeepSeek-R1:通过强化学习激励大语言模型的推理能力
核心内容
本文介绍了DeepSeek-R1,这是DeepSeek-AI推出的第一代推理模型,旨在通过强化学习(Reinforcement Learning, RL)提升大语言模型(LLMs)的推理能力。研究团队提出了两种模型:DeepSeek-R1-Zero和DeepSeek-R1,分别代表了无监督强化学习和结合冷启动数据的多阶段强化学习。此外,还通过知识蒸馏技术将DeepSeek-R1的推理能力传递给更小的模型,以提高推理性能和效率。
主要观点
- 强化学习驱动推理能力:通过纯RL训练,DeepSeek-R1-Zero在无需监督微调(SFT)的情况下,自然地发展出强大的推理行为,如自我验证、反思和生成长链式推理(CoT)。
- 冷启动数据优化:DeepSeek-R1在DeepSeek-R1-Zero的基础上,引入了少量高质量的冷启动数据,以提升推理的可读性和语言一致性。
- 多阶段训练:DeepSeek-R1采用多阶段训练策略,包括冷启动数据微调、推理导向的RL训练、拒绝采样生成SFT数据,以及最终的全场景RL训练,以实现更全面的模型优化。
- 知识蒸馏:通过知识蒸馏技术,DeepSeek-R1的推理能力被成功传递到更小的模型中,如1.5B、7B、8B、14B、32B和70B的模型,显著提升了它们的推理性能。
关键信息
模型概述
- DeepSeek-R1-Zero:基于DeepSeek-V3-Base模型,直接应用RL训练,无需SFT作为预处理。它在AIME 2024等推理基准上表现出色,如pass@1从15.6%提升至71.0%,并可通过多数投票进一步提升至86.7%。
- DeepSeek-R1:在冷启动数据微调的基础上,进行多阶段RL训练,最终达到与OpenAI-o1-1217相当的推理性能,并在多个基准上表现优异。
推理性能
- AIME 2024:DeepSeek-R1的pass@1为79.8%,略高于OpenAI-o1-1217;cons@64为83.3%。
- MATH-500:DeepSeek-R1的pass@1为97.3%,表现优于其他模型。
- GPQA Diamond:DeepSeek-R1的pass@1为71.5%,显著优于DeepSeek-V3。
- LiveCodeBench:DeepSeek-R1的pass@1为94.3%,优于DeepSeek-V3。
- CodeForces:DeepSeek-R1的Elo评分达到2029,优于96.3%的人类参赛者。
知识蒸馏成果
- Qwen系列模型:通过蒸馏,DeepSeek-R1-Distill-Qwen-7B在AIME 2024上达到55.5%,优于QwQ-32B-Preview。
- Llama系列模型:蒸馏后的Llama-3.1-8B和Llama-3.3-70B在多个推理基准上表现出色,其中32B和70B模型创造了新的记录。
方法创新
- 强化学习算法:采用Group Relative Policy Optimization (GRPO),通过组内评分计算基线,避免了传统RL中需要critic模型的高成本。
- 奖励建模:使用基于规则的奖励模型,包括准确性和格式奖励,确保模型输出的正确性和可读性。
- 冷启动数据:通过人工标注和后处理,收集了数千条高质量的推理数据,用于微调模型,提升推理过程的可读性和语言一致性。
未来工作与影响
- 开源贡献:DeepSeek-R1-Zero和DeepSeek-R1模型已开源,支持研究社区进一步探索推理模型的优化。
- 小模型增强:通过知识蒸馏,将DeepSeek-R1的推理能力传递给更小的模型,使得小模型在推理任务上也能表现出色。
- 多场景适配:最终的RL训练阶段考虑了所有场景的提示,以提升模型的通用性和实用性。
挑战与改进
- DeepSeek-R1-Zero的局限性:尽管表现出色,但其推理过程存在可读性差和语言混合的问题。
- 冷启动数据的引入:通过冷启动数据和多阶段训练,有效缓解了这些问题,同时进一步提升了推理性能。
结论
本文展示了通过强化学习直接提升LLMs推理能力的潜力,验证了纯RL训练可以有效激励模型发展复杂的推理行为。同时,通过冷启动数据和多阶段训练策略,进一步优化了模型的可读性和实用性。最后,知识蒸馏技术使得推理能力得以在小型模型中实现,为实际应用提供了更多可能性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载