【DeepSeek】R1-通过以下方式激励LLMs中的推理能力强化学习_22页_1mb
报告摘要
总结:DeepSeek-R1:通过强化学习提升LLMs的推理能力
核心内容
本文介绍了DeepSeek-AI团队开发的DeepSeek-R1模型及其推理能力提升方法。DeepSeek-R1是基于强化学习(Reinforcement Learning, RL)的推理模型,其前身是DeepSeek-R1-Zero,该模型在没有监督微调(Supervised Fine-Tuning, SFT)的前提下,通过大规模RL训练获得了强大的推理能力。DeepSeek-R1在此基础上引入了冷启动数据和多阶段训练流程,进一步提升了模型的推理性能与可读性。此外,团队还通过知识蒸馏技术,将DeepSeek-R1的推理能力转移到更小的模型上,使得这些模型也能在推理任务中表现出色。
主要观点
1. 推理能力的强化学习提升
- DeepSeek-R1-Zero:首次展示了LLMs可以通过纯RL训练获得强大的推理能力,无需依赖SFT数据。该模型在AIME 2024基准测试中,通过RL训练,pass@1分数从15.6%提升至71.0%,并可通过多数投票进一步提升至86.7%,接近OpenAI-o1-0912的性能。
- RL算法:采用Group Relative Policy Optimization (GRPO),通过群体评分估计基线,避免使用与策略模型相同规模的批评模型,从而节省训练成本。
- 奖励建模:使用基于规则的奖励系统,包括准确性奖励(如数学题答案是否正确)和格式奖励(如将推理过程限制在
</think>和<answer>标签内)。
2. 冷启动与多阶段训练
- 冷启动数据:通过收集数千个长推理链(Chain-of-Thought, CoT)数据,对DeepSeek-V3-Base进行微调,作为RL训练的起点,以提升模型的可读性和推理一致性。
- 语言一致性奖励:在RL训练中引入语言一致性奖励,以减少语言混杂问题,提升输出的可读性。
- 多阶段训练:DeepSeek-R1采用了两阶段SFT和两阶段RL训练,使得模型在推理和非推理任务上均表现出色。
3. 知识蒸馏与模型优化
- 蒸馏方法:通过知识蒸馏技术,将DeepSeek-R1的推理能力转移到更小的模型(如Qwen和Llama系列),显著提升了小模型的推理表现。
- 蒸馏结果:蒸馏后的14B模型在AIME 2024中得分55.5%,显著优于QwQ-32B-Preview;32B和70B模型则在多个推理基准测试中创下了新纪录。
- 蒸馏目标:展示小模型也可以具备强大的推理能力,为研究社区提供更高效的推理模型。
关键信息
3.1 DeepSeek-R1的评估结果
- 推理任务:
- 在AIME 2024中,pass@1得分为79.8%,略高于OpenAI-o1-1217。
- 在MATH-500中,pass@1得分为97.3%,与OpenAI-o1-1217表现相当。
- 在LiveCodeBench中,pass@1得分为57.2%,显著优于DeepSeek-V3。
- 在Codeforces中,DeepSeek-R1的Elo评分达到2029,优于96.3%的人类参赛者。
- 知识任务:
- 在MMLU、MMLU-Pro和GPQA Diamond等基准测试中,DeepSeek-R1分别取得90.8%、84.0%和71.5%的得分,远超DeepSeek-V3。
- 其他任务:
- 在创意写作、通用问答、编辑、摘要等任务中表现优异。
- 在AlpacaEval 2.0中,长度控制的胜率高达87.6%。
- 在ArenaHard中,胜率为92.3%。
- 在长上下文理解任务中,DeepSeek-R1表现优于DeepSeek-V3。
3.2 模型开源
- DeepSeek-R1-Zero、DeepSeek-R1及六种蒸馏模型(1.5B、7B、8B、14B、32B、70B)均被开源,支持研究社区进一步探索推理模型的优化与应用。
未来工作与局限性
- 未来方向:进一步探索RL在推理任务中的优化,以及如何将推理能力扩展到更多场景。
- 局限性:DeepSeek-R1-Zero在初期存在语言混杂和可读性差的问题,而DeepSeek-R1虽然解决了这些问题,但在部分基准测试中仍略逊于OpenAI-o1-1217。
- 蒸馏限制:蒸馏过程中未包含RL阶段,因此小模型的推理能力可能不如DeepSeek-R1直接训练的版本,但已证明其有效性。
结论
DeepSeek-R1通过纯RL训练和冷启动数据的结合,显著提升了LLMs的推理能力,并在多个基准测试中表现优异。此外,通过知识蒸馏技术,团队成功将推理能力转移到更小的模型中,为研究社区提供了高效且强大的推理模型。这些成果为未来推理模型的发展奠定了坚实的基础。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载