> **来源:[研报客](https://pc.yanbaoke.cn)** # 大模型赋能投研系列之二十:Kimi K3 超越 GPT 5.6 吗?——投研 Agent 模型能力对比评测总结 ## 核心内容 本次报告对比了 GPT 5.6 Sol、Kimi K3 和 GLM-5.2 三款大模型在估值建模、多因子回测和行业研究三类金融投研任务中的表现,旨在评估其在复杂任务中的执行能力和交付质量。报告指出,虽然三款模型均具备完成投研任务的基础能力,但 GPT 5.6 Sol 在任务完成度、研究细节保留、长程执行稳定性方面表现最佳,Kimi K3 在报告结构和分析逻辑方面表现较好,但存在底稿联动和任务执行稳定性问题,GLM-5.2 在任务成本方面具有优势,但在底稿质量、结论逻辑闭环和数据来源完整性方面表现欠佳。 ## 主要观点 1. **任务完成度**:三款模型均能够独立完成结构化估值建模、多因子回测和行业研究任务,具备一定的金融投研能力。 2. **模型能力对比**: - **GPT 5.6 Sol**:综合表现最佳,具备较强的模型联动性和检查机制,能够生成可复算的模型底稿和逻辑闭环的投资报告。 - **Kimi K3**:报告结构和逻辑较好,但底稿联动性不足,存在部分公式错误和任务执行稳定性问题。 - **GLM-5.2**:成本最低,但模型质量较差,存在公式报错、结论与估值冲突、数据与报告脱节等问题。 3. **任务执行与交付**: - GPT 5.6 Sol 的任务执行更为规范,特别是在交易时点的处理上,采用“月末形成信号、下一交易日执行”的方式,有效避免了时点偏差。 - Kimi K3 在任务执行过程中曾出现数据库连接中断问题,但利用已有数据完成了任务,不影响整体交付。 - GLM-5.2 虽然回测区间较长,但缺乏对交易成本和不可交易状态的完整处理,且底稿和报告之间缺乏充分的中间过程披露。 ## 关键信息 ### 1. 模型规格与价格 | 模型 | 总参数 | 激活参数 | 上下文 | 最大输出Token | 输入(缓存命中)价格 | 输入(缓存未命中)价格 | 输出价格 | |--------------|--------|----------|--------|----------------|--------------------|----------------------|-----------| | Kimi K3 | 2.8T | - | 1M | - | 0.3 美元 | 3 美元 | 15 美元 | | GPT 5.6 Sol | - | - | 1.05M | 128k | 0.5 美元 | 5 美元 | 30 美元 | | GLM-5.2 | 744B | 40B | 1M | 128k | 限时免费 | 8 元 | 28 元 | ### 2. 任务表现对比 | 任务类型 | GPT 5.6 Sol | Kimi K3 | GLM-5.2 | |----------------|-------------|---------|---------| | **估值建模** | 可自动联动,检查机制完善 | 报告逻辑自洽,但底稿联动性弱,存在公式错误 | 核心公式报错,结果无法复核,报告与模型逻辑冲突 | | **多因子回测** | 交易时点处理最严谨,执行规范 | 交付完整,但未区分信号日和执行日,未处理交易成本 | 回测区间最长,但未区分信号日和执行日,未处理交易成本 | | **行业研究** | 研究逻辑规范,来源管理完整 | 报告完整,但Wiki内容沉淀不足 | 覆盖公司最多,但投资框架逻辑不清,来源管理不完整 | ### 3. 模型表现排序 - **GPT 5.6 Sol**:综合排名第一,任务完成度、模型质量、报告逻辑闭环均优于其他模型。 - **Kimi K3**:综合排名第二,报告结构完整,但底稿联动和执行稳定性不足。 - **GLM-5.2**:综合排名第三,任务成本最低,但模型质量与报告逻辑存在明显缺陷。 ## 风险提示 - 模型输出结果基于历史数据,不能保证未来表现。 - 策略依赖假设,交易成本变化可能影响收益。 - 模型存在随机性和准确性风险,需注意版权和使用风险。 - 投资建议需结合实际市场情况,不能完全依赖模型输出。 ## 总结 本次评测表明,GPT 5.6 Sol 在金融投研任务中的综合表现最佳,尤其在模型联动、检查机制和逻辑闭环方面具有显著优势。Kimi K3 虽然在报告结构和逻辑方面表现良好,但在底稿联动性和任务执行稳定性方面仍有提升空间。GLM-5.2 以较低的成本和较长的回测区间为优势,但在模型质量、报告逻辑和数据完整性方面表现较弱。未来,随着更多测试和优化,三款模型在金融投研领域的表现仍有进一步提升的空间。