20230316-德邦证券-德邦金工文献精译第八期_训练语言模型以遵循带有人类反馈的指令_30页_2mb
报告摘要
金融工程专题:训练语言模型以遵循带有人类反馈的指令
核心内容
本报告介绍了OpenAI的InstructGPT模型,它是通过人类反馈进行微调的大型语言模型。该模型是GPT-3系列的改进版本,通过结合监督学习和强化学习的方法,使模型更好地遵循用户指令,并提高其真实性、减少毒性输出。
主要观点
- 模型改进:InstructGPT模型(最小13亿参数量)在多个任务上表现优于GPT-3(1750亿参数量),尤其是在遵循用户指令和减少有害输出方面。
- 训练方法:InstructGPT模型的训练过程分为三个阶段:
- 监督微调(SFT):使用标注员提供的演示数据对GPT-3进行微调。
- 奖励模型(RM)训练:通过收集模型输出之间的比较数据,训练奖励模型以预测人类偏好。
- 强化学习(PPO)优化:使用奖励模型对监督策略进行进一步优化。
- 泛化能力:InstructGPT在未见过的指令上表现出良好的泛化能力,包括其他语言的指令和代码相关的任务。
- 局限性:模型仍可能产生错误信息、毒性内容,以及不遵循指令的情况。此外,标注员的偏好可能不能代表更广泛的人类价值观。
- 未来方向:需要探索如何更好地结合人类反馈与模型控制技术,以减少偏见和有害输出,并达成更广泛的价值观共识。
关键信息
模型训练与评估
- 标注员团队:由40名标注员参与,负责生成演示数据和对模型输出进行人工评估。
- 数据集:
- SFT数据集:约13000个训练提示。
- RM数据集:约33000个训练提示。
- PPO数据集:约31000个训练提示。
- 评估方式:
- 人工评估:标注员对模型输出进行质量评分和偏好评分。
- 公开NLP数据集:如TruthfulQA、RealToxicityPrompts、Winogender、CrowS-Pairs等,用于衡量模型的真实性和偏差。
模型表现
- 真实性:在TruthfulQA数据集上,InstructGPT模型生成真实且信息丰富的答案的频率是GPT-3的两倍。
- 毒性:在RealToxicityPrompts数据集上,InstructGPT模型的毒性输出减少了约25%,但在Winogender和CrowS-Pairs数据集上没有显著改善。
- 指令遵循:InstructGPT在指令遵循任务上表现更优,尤其是在封闭域任务中减少了“幻觉”(编造信息)的发生率。
- 性能衰减:在公开NLP数据集上,InstructGPT模型在部分任务(如SQuAD、DROP等)上表现略差于GPT-3,但可以通过混合PPO更新和预训练分布的梯度来减少性能衰减。
模型泛化能力
- InstructGPT能够泛化到未在训练数据中出现的指令,包括非英语语言和代码相关任务。
- 模型在“留出”标注员的偏好上表现良好,表明其泛化能力优于GPT-3。
风险提示
- 数据不完备和滥用风险:模型可能被滥用或用于不适当的目的。
- 信息安全风险:模型可能泄露用户隐私信息。
- 算法伦理风险:模型可能产生偏见、有害或不道德的输出。
结构概述
- 摘要:介绍InstructGPT模型及其训练方法。
- 简介:讨论语言模型对齐的重要性及当前存在的问题。
- 相关工作:回顾以往的对齐研究和模型训练方法。
- 方法与实验细节:
- 高级方法:使用RLHF(Reinforcement Learning from Human Feedback)进行模型训练。
- 数据集:包括SFT、RM和PPO数据集。
- 任务:涵盖生成、问答、对话、摘要等任务。
- 人工数据收集:标注员参与数据标注和模型评估。
- 模型训练:使用PPO算法进行强化学习优化。
- 评价:包括人工评估和公开数据集的自动评估。
- 结果:
- API提示分布结果:InstructGPT在指令遵循和减少有害输出方面表现更优。
- 公开NLP数据集结果:在TruthfulQA等数据集上,模型表现出更高的真实性和更少的偏差。
- 定性结果:展示模型在处理非英语指令和代码任务时的能力,以及其仍存在的简单错误。
开放性问题与未来方向
- 如何减少模型的偏见和有害输出?
- 如何更好地结合人类反馈和模型控制方法?
- 如何在模型中融合不同群体的价值观?
- 如何减少对齐过程中对模型性能的影响(即“对齐税”)?
图表与数据
- 图1:人工评估各模型在API提示分布上的表现。
- 图2:构建InstructGPT的三个步骤(SFT、RM训练、PPO优化)。
- 图3:API提示数据集的用例分布。
- 图4:API分布上的标注员收集的元数据。
- 图5:模型的偏好结果。
- 图6:API分布的元数据结果。
- 图7:模型与FLAN、T0等模型的对比结果。
- 图8:TruthfulQA数据集的结果。
- 图9:RealToxicityPrompts上的人工与自动评估对比。
- 图10:InstructGPT在不同任务上的泛化示例。
- 图11:InstructGPT在代码问答中的简单错误示例。
总结
InstructGPT模型通过结合人类反馈的强化学习方法,显著提高了语言模型在遵循用户指令、生成真实信息和减少有害输出方面的能力。尽管其在某些任务上仍存在性能衰减和简单错误,但其在指令遵循和安全性方面表现优于GPT-3。未来的研究应关注如何进一步优化模型的对齐过程,以减少偏见和有害输出,并提高模型的广泛适用性和可控性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载