中文大模型基准测评2023年度报告-SuperCLUE_38页_6mb
报告摘要
2023年中文大模型基准测评报告显示,自2022年11月ChatGPT发布以来,国内大模型在半年内完成三个阶段发展:准备期(形成共识)、成长期(数量质量增长)、爆发期(百模大战)。GPT-4Turbo以8979分总分遥遥领先,国内文心一言40(7402分)及Yi-34B-Chat(7123分)表现突出,共有8个模型超过GPT35,200亿参数级开源模型Baichuan2-13B-Chat、Qwen-14B-Chat、XVERSE-13B-Chat-2等在中文场景表现优于Llama2-13B-Chat。
测评体系SuperCLUE涵盖四大维度、十大任务,包含多轮主观题(OPEN)和客观选择题(OPT)。OPEN权重占比60%,用于评估语言生成、对话能力等,OPT占40%测试计算逻辑等专业能力。国内模型在基础能力(计算、逻辑、代码)上表现较弱,但语言理解与生成能力已追平国际领先模型,工具使用能力中Baichuan2-13B-Chat以6538分超过GPT35。安全维度Claude2、Yi-34B-Chat等表现优于GPT系列。
国内大模型呈现多元竞争格局,头部企业(百度、阿里云、vivo等)与创业公司(百川智能、元象科技等)共同推进技术发展。在具体应用场景中,文心一言40在科研、教育、工业领域具有优势;通义千问20擅长金融、医疗、汽车等垂直场景;BlueLM在手机端智能应用表现突出;Baichuan2-13B-Chat适合内容创作及低算力部署;XVERSE-13B-Chat-2在长文本处理及角色扮演能力上领先。整体看,国内模型在中文场景的适应性方面具有明显优势,但核心能力与GPT系列仍存在差距。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载