如何提升大模型通用推理能力?DeepSeek最新论文《CODEIO:通过代码输入输出预测凝练推理模式》_18页_1mb
报告摘要
CodeIO:一种通过代码输入输出预测凝练推理模式的新方法
CodeIO是一种旨在提升大语言模型(LLMs)推理能力的新方法。传统方法大多关注狭窄技能的提升,例如数学或代码生成,而其他推理任务由于训练数据稀疏且结构不完整,效果不佳。CodeIO通过将原始代码转化为“代码输入-输出预测”任务,使模型在自然语言的思维链(CoT)中学习代码背后复杂的推理模式,从而全面提升模型在符号、科学、逻辑、数学和常识等多领域任务上的推理能力。
该方法的核心是通过在执行代码的基础上收集大量输入-输出数据对,并利用大模型生成自然语言推理过程(CoT),构建高质量的训练数据集。此外,CodeIO还提出了“CodeIO++”,这是通过多轮推理改进(re-execution verification)提升数据质量的增强版。实验证明,CodeIO++不仅在多数推理任务上表现更优,而且创造了一种平衡且通用的推理能力,既能提升特定领域的表现,又能推广到诸如逻辑推理、数学解题等多个任务类型。
使用的数据来自代码实现逻辑推理的多样化场景,如算法库、数学问题库以及编程竞赛平台。研究团队从公开数据集中收集了超过80万份代码文件,经过清理、结构化处理后,生成350万对输入与输出样本。在多阶段训练策略中,第一阶段利用这些数据训练代码输入输出预测任务,第二阶段则结合通用指令微调数据,进一步增强模型在多种推理任务上的表现与适应性。
实验采用了多模型、多基准评测,包括Drop、WinoGrande、GSM8K、MATH等14个推理任务,涵盖科学、数学、逻辑、常识等多个维度。结果表明,与现有大规模数据集相比,CodeIO在4个不同规模的模型上都实现了统一且显著的性能提升。特别是在数据有效性方面,CodeIO和CodeIO++分别在不同模型上提升了模型推理泛化能力。
CodeIO不仅验证了使用代码输入输出任务来训练模型进行通用推理的有效性,还凸显了通过执行追踪反馈实现推理过程优化的新范式。该案例为开发下一代大模型推理能力提供了一个有组织、可扩展的训练数据基础,显示了代码作为通用推理输入形式的潜力。
试读结束,高清完整版pdf/doc/ppt,请点下载