20250814-浙商证券-大模型评测框架暨AI投研系列之三_如何对比GPT5和DeepSeek谁更强_5页_1001kb
报告摘要
大模型评测框架摘要
核心观点
本文旨在讨论GPT-5发布后如何客观评价大模型的综合技术能力,特别是应对当前国内外大模型竞争加剧、技术与营销边界模糊的情况。测试中认为GPT-5在性能方面提升有限,主要亮点在编程能力和价格竞争力。
大模型评测现状
随着大模型开源加速,国内如Kimi K2、Qwen3-Coder、GLM-4.5等模型在性能上表现突出。各大模型的测试评价体系主要围绕编程、数学/科学、工具调用等多个任务展开,具体框架包括:
- 编程任务:SWE-bench、LiveCodeBench、OJBench
- 数学/科学任务:AIME2005、GPOA-Diamod
- 工具调用与Agent互动:Tau2、AceBench
主流评测方式
主要分为两大类:
- 表现超越基准模型:以传统学术论文范式出发,通过经典框架评测模型能力,主要评测框架及简介如下:
| 评测任务 | 评测框架 | 简介 |
|---|---|---|
| 代码Bug修复能力 | SWE-bench | 基于GitHub真实案例,测AI改代码成功率 |
| 竞赛级编程能力 | LiveCodeBench | 基于LeetCode等竞赛题评测模型表现 |
| 高校数学素养 | AIME2005 & GPAO-Diamond | 都是高水平学术问题,GP代表难倒搜索引擎 |
| Agent多智能体协作能力 | AceBench | 通过多轮模拟交互检测复杂任务处理及交互协作能力 |
- 用户双盲打分投票:LMArena等平台让用户进行模型间匿名投票,代表“大众点评”式的排名。如图2所示,投票结果对公司排名影响巨大。
评测框架的问题
- 商业刷榜风险: 如Leaderboard Illusion中提到,科技公司可能利用评分漏洞刷 ranking。
- 静态基准局限: 最传统的评测依然是基于固定题库,这可被有针对性地调参操作。为此,学术界提出LLM-Crowdsourced等动态互评方案,通过模型互相出题、独立回答、评分来解决题库瓶颈。如图3所示,动态框架力求更真实地模拟人类协作与评价逻辑。
更好的应对:锚定真实业务场景
最合理的是依据金融业务明确构建任务测试样本。建议不盲目相信榜单,而是以自己的任务为目标模型。比如作者在报告中用DeepSeek、Kimi等模型处理每日精读研报、基金分析任务,来评测模型在具体执行上的表现。
Agent评价是未来方向:并非只评测模型,而是智能体Agent,需全面评估四大维度(输出、过程、可靠性、资源效率)。
风险与注意
- AI系统的输出依赖数据,历史信息多,但其参数调整会走样。
- AI内容无法保证百分百准确,错漏可能导致最终结论偏差,甚至误导投资决策。
- 评测核心在于匹配实际需求,避免沦为“为了评测而评测”的标准陷阱。
总结
大模型评测方法多样,参数对比或用户打分各有优劣。建议金融从业者根据模型在实际任务中的表现与其通用能力进行选择,避免陷入权威“基准分数”的浮躁之中。真正的AI金融应用落脚点是**“可靠的决策辅助工具”**,而非替代人类。只有适配实际业务目标,AI工具才能真正助力专业化决策。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载