复旦大学(张奇):2023年大语言模型评测报告-69页_8mb
报告摘要
大语言模型评测是推动自然语言处理(NLP)发展的关键环节,但面临评测周期缩短和算法快速超越人类的问题,如Dynabench案例所示。首先,大语言模型主要有三个阶段:预训练、指令微调(SFT)和强化学习(RL),每个阶段有特定的数据需求和资源消耗,例如预训练使用数千亿单词数据,而指令微调和RL则依赖用户指令和强化学习奖励函数。
评测方面,基础语言模型可能缺乏指令理解能力,但SFT和RL模型能处理多样化任务并服从人类指令,因此评测方法需根据模型种类差异。常见评测基准包括HELM(全面评估,涵盖场景、任务和指标,如准确性、鲁棒性、公平性等),AGI-EVAL(人类中心评估,在标准化考试中测试模型表现),MT-Bench和Chatbot Arena(使用LLM裁判进行成对比较或Elo评分),C-EVAL(中文评测,涵盖学科知识),以及FlagEval(三维框架,评估准确性、不确定性、鲁棒性和效率)。评测维度通常包括客观题(如选择题)和主观题(如开放回答),方法有自动评估(如GPT-4自动打分)和人工评测,各有优缺点:自动评测快速高效但细粒度准确性低,人工评测准确但速度慢。
主要评测结果表明,GPT-4等大模型在准确性、生成能力和推理方面表现领先,但存在偏见、效率和鲁棒性问题。开源模型与闭源模型之间差距随时间变化,需动态评估。评测应模拟真实用户场景,包括生成任务和高难度问题,并采用混合评估框架以提高公平性。未来评测需关注多学科覆盖、避免作弊,并优化排序方法如Elo评分和积分制。
(字数:652)
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载