20260719-国金证券-大模型赋能投研系列之二十三_Kimi_K3超越GPT_5.6了吗_-投研Agent模型能力对比评测_26页_3mb
报告摘要
大模型赋能投研系列之二十:Kimi K3 超越 GPT 5.6 吗?——投研 Agent 模型能力对比评测总结
核心内容
本次报告对比了 GPT 5.6 Sol、Kimi K3 和 GLM-5.2 三款大模型在估值建模、多因子回测和行业研究三类金融投研任务中的表现,旨在评估其在复杂任务中的执行能力和交付质量。报告指出,虽然三款模型均具备完成投研任务的基础能力,但 GPT 5.6 Sol 在任务完成度、研究细节保留、长程执行稳定性方面表现最佳,Kimi K3 在报告结构和分析逻辑方面表现较好,但存在底稿联动和任务执行稳定性问题,GLM-5.2 在任务成本方面具有优势,但在底稿质量、结论逻辑闭环和数据来源完整性方面表现欠佳。
主要观点
- 任务完成度:三款模型均能够独立完成结构化估值建模、多因子回测和行业研究任务,具备一定的金融投研能力。
- 模型能力对比:
- GPT 5.6 Sol:综合表现最佳,具备较强的模型联动性和检查机制,能够生成可复算的模型底稿和逻辑闭环的投资报告。
- Kimi K3:报告结构和逻辑较好,但底稿联动性不足,存在部分公式错误和任务执行稳定性问题。
- GLM-5.2:成本最低,但模型质量较差,存在公式报错、结论与估值冲突、数据与报告脱节等问题。
- 任务执行与交付:
- GPT 5.6 Sol 的任务执行更为规范,特别是在交易时点的处理上,采用“月末形成信号、下一交易日执行”的方式,有效避免了时点偏差。
- Kimi K3 在任务执行过程中曾出现数据库连接中断问题,但利用已有数据完成了任务,不影响整体交付。
- GLM-5.2 虽然回测区间较长,但缺乏对交易成本和不可交易状态的完整处理,且底稿和报告之间缺乏充分的中间过程披露。
关键信息
1. 模型规格与价格
| 模型 | 总参数 | 激活参数 | 上下文 | 最大输出Token | 输入(缓存命中)价格 | 输入(缓存未命中)价格 | 输出价格 |
|---|---|---|---|---|---|---|---|
| Kimi K3 | 2.8T | - | 1M | - | 0.3 美元 | 3 美元 | 15 美元 |
| GPT 5.6 Sol | - | - | 1.05M | 128k | 0.5 美元 | 5 美元 | 30 美元 |
| GLM-5.2 | 744B | 40B | 1M | 128k | 限时免费 | 8 元 | 28 元 |
2. 任务表现对比
| 任务类型 | GPT 5.6 Sol | Kimi K3 | GLM-5.2 |
|---|---|---|---|
| 估值建模 | 可自动联动,检查机制完善 | 报告逻辑自洽,但底稿联动性弱,存在公式错误 | 核心公式报错,结果无法复核,报告与模型逻辑冲突 |
| 多因子回测 | 交易时点处理最严谨,执行规范 | 交付完整,但未区分信号日和执行日,未处理交易成本 | 回测区间最长,但未区分信号日和执行日,未处理交易成本 |
| 行业研究 | 研究逻辑规范,来源管理完整 | 报告完整,但Wiki内容沉淀不足 | 覆盖公司最多,但投资框架逻辑不清,来源管理不完整 |
3. 模型表现排序
- GPT 5.6 Sol:综合排名第一,任务完成度、模型质量、报告逻辑闭环均优于其他模型。
- Kimi K3:综合排名第二,报告结构完整,但底稿联动和执行稳定性不足。
- GLM-5.2:综合排名第三,任务成本最低,但模型质量与报告逻辑存在明显缺陷。
风险提示
- 模型输出结果基于历史数据,不能保证未来表现。
- 策略依赖假设,交易成本变化可能影响收益。
- 模型存在随机性和准确性风险,需注意版权和使用风险。
- 投资建议需结合实际市场情况,不能完全依赖模型输出。
总结
本次评测表明,GPT 5.6 Sol 在金融投研任务中的综合表现最佳,尤其在模型联动、检查机制和逻辑闭环方面具有显著优势。Kimi K3 虽然在报告结构和逻辑方面表现良好,但在底稿联动性和任务执行稳定性方面仍有提升空间。GLM-5.2 以较低的成本和较长的回测区间为优势,但在模型质量、报告逻辑和数据完整性方面表现较弱。未来,随着更多测试和优化,三款模型在金融投研领域的表现仍有进一步提升的空间。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载