> **来源:[研报客](https://pc.yanbaoke.cn)** # 金融工程组:GLM-5.3 与 GLM-5.3-Flash 评测总结 ## 核心内容概述 本文对 GLM-5.3 与 GLM-5.3-Flash 两款模型在金融投研任务中的表现进行了详细评测,涵盖了估值、回测与行业研究三类任务。评测结果显示,GLM-5.3 在估值任务中表现最佳,其模型结构完整、公式联动性强,具备良好的可重算性。GLM-5.3-Flash 在工具和自动化方面表现突出,但其在某些复杂推理任务中略逊于 GLM-5.3。 ## 主要观点 - **模型定位**: - GLM-5.3 基于 GLM-5.2 底座,通过后训练提升复杂编程与工具执行能力,主打长程 Agent、深度推理与安全性。 - GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,支持文本、图像与视频输入,采用 320B 总参 / 18B 激活,权重 MIT 开源,适用于低成本、多模态任务。 - **性能提升**: - GLM-5.3 相比 GLM-5.2 在 DeepSWE 上提升 44.8%,在 AutomationBench v1.0.6 上提升 84.0%。 - GLM-5.3-Flash 在 DeepSWE、Toolathlon、Automation 上表现优于 GLM-5.2,甚至局部超过自家旗舰。 - **API 价格与性价比**: - GLM-5.3 价格与 GLM-5.2 相同:未命中输入 8 元、输出 28 元 / 百万 Token。 - GLM-5.3-Flash 价格约为 GLM-5.3 的 1/10,限时折扣后为 1/20,性价比高。 - 与 V4 Flash 和 V4 Pro 对比,GLM-5.3-Flash 在相同场景下价格优势显著,适合批量任务和默认执行层。 - **本地部署**: - GLM-5.3-Flash 的权重体积为 306 GiB(FP8),比 V4 Flash 更重,但比 GLM-5.3 更易部署。 - 本地部署时,GLM-5.3-Flash 需为视觉模块预留显存,而 V4 Flash 可通过独立 Vision-Exp 实现多模态功能。 - **金融投研任务表现**: - 估值任务:GLM-5.3 综合排名第一,具备完整的产品拆解、三表联动与敏感性分析,但需人工复核部分假设;GLM-5.3-Flash 排名第二,模型结构完整,但三表简化。 - 回测任务:GLM-5.3 交付完整数据链与纠错过程,但未考虑交易摩擦;GLM-5.3-Flash 样本期更长,但执行偏研究口径,缺乏交易约束。 - 行业研究任务:GLM-5.3 公司覆盖广、数据更新及时;GLM-5.3-Flash 页面多,但原始资料与反链较弱;V4 Pro 提供了更完整的 Wiki 知识库与来源治理。 ## 关键信息 ### 1.1 模型定位与架构基础 | 模型 | 底座 | 上下文 | 最大输出 | 输入模态 | 接口 | 是否支持多模态 | |------|------|--------|----------|----------|------|----------------| | GLM-5.3 | GLM-5.2 | 1M | 128K | 文本 | OpenAI Chat Completions、Responses、Anthropic | 否 | | GLM-5.3-Flash | 新底座(320B/18B) | 1M | 128K | 文本/图像/视频 | Chat Completions | 是 | ### 1.2 模型通用能力评价 | 评测基准 | GLM-5.2 | GLM-5.3 | GLM-5.3-Flash | 提升幅度 | |----------|--------|---------|----------------|-----------| | HLE (w/ tools) | 54.7 | 62.5 | 55.3 | +14.3% / +1.1% | | Terminal Bench 2.1 | 81 | 88.2 | 84.3 | +8.9% / +4.1% | | DeepSWE v1.1 | 46.2 | 66.9 | 63.4 | +44.8% / +37.2% | | Toolathlon Verified | 59.9 | 73 | 78.4 | +21.9% / +30.9% | | AutomationBench v1.0.6 | 26.2 | 48.2 | 48.8 | +84% / +86.3% | ### 1.3 API 价格与性价比分析 | 模型 | 缓存命中(元/百万 Token) | 未命中输入(元/百万 Token) | 输出(元/百万 Token) | 价格优势 | |------|---------------------------|-----------------------------|------------------------|-----------| | GLM-5.3 | 2 | 8 | 28 | 与 5.2 同价,无峰谷 | | GLM-5.3-Flash | 0.23(标价) / 0.115(折扣) | 0.8(标价) / 0.4(折扣) | 2.8(标价) / 1.4(折扣) | 标价约 5.3 的 1/10,折扣约 1/20 | ### 1.4 本地部署可行性分析 | 指标 | GLM-5.3-Flash | DeepSeek V4 Flash | |------|----------------|--------------------| | 总参数/激活 | 320B / 18B | 284B / 13B | | 官方权重体积 | 约 306 GiB (FP8) | 约 167GB (FP4+FP8) | | 长上下文设计 | 稀疏+线性注意力、IndexPool | MXFP4 用于 Indexer QK | | 模态支持 | 原生文本/图像/视频 | 文本,视觉为独立模块 | | 部署成本 | 较高 | 较低 | ### 2.1 估值任务实测结果 | 模型 | 工作表数 | 底稿可复算 | 数据完整度 | Excel 质量 | 投资建议逻辑 | 综合表现 | |------|----------|------------|------------|------------|----------------|-----------| | GLM-5.3 | 10 | 是 | 16 份查询、8 篇研报 | 分产品量价贯通三表与估值 | 报告与模型同源 | 第一 | | GLM-5.3-Flash | 10 | 是 | 历史财务、两分部量价 | 跨表公式可重算 | 报告与模型方向一致 | 第二 | | DeepSeek V4 Pro | 12 | 否 | 历史财务、2026Q1、盈利预测 | 公式错位、修改假设无法更新 | 报告审慎 | 第五 | | DeepSeek V4 Flash | 10 | 是 | 历史财务、经营预测、三表 | 跨表联动完整 | 报告逻辑自洽 | 第三 | | Kimi K3 | 10 | 否 | 历史财务、盈利预测 | 公式错误影响联动 | 报告逻辑自洽 | 第四 | ### 2.2 回测任务实测结果 | 模型 | 样本期 | 调仓期 | 回测逻辑 | 交易摩擦处理 | 底稿质量 | 报告质量 | |------|--------|--------|----------|----------------|-----------|-----------| | GLM-5.3 | 2014.01-2026.06 | 150 期 | 数据链完整、纠错过程 | 未扣成本、未设执行日 | 保留完整数据链 | 报告说明因子定义与局限 | | GLM-5.3-Flash | 2006.08-2026.08 | 241 期 | 交易摩擦处理不足 | 未设执行日、未扣成本 | 数据链完整 | 报告说明因子定义与局限 | | DeepSeek V4 Pro | 2014.01-2026.06 | 150 期 | 使用次日收盘、扣除单边成本 | 有部分细节问题 | 保留数据链 | 报告说明因子定义与局限 | | DeepSeek V4 Flash | 2014.01-2026.06 | 150 期 | 使用月末收盘、等权合成 | 未扣成本、未设执行日 | 数据链完整 | 报告说明因子定义与局限 | | Kimi K3 | 2014.01-2026.06 | 150 期 | 交付代码、Excel 和 CSV | 数据链不完整 | 报告说明因子定义与局限 | 报告说明因子定义与局限 | ### 2.3 行业研究任务实测结果 | 模型 | 报告完整性 | Wiki 资源 | 数据来源 | 投资框架 | 综合表现 | |------|------------|-----------|-----------|------------|-----------| | GLM-5.3 | 完整 | LLM Wiki 索引、目录复核 | 数据来源清单 | 投资框架完整 | 第一 | | GLM-5.3-Flash | 页面多 | LLM Wiki 索引 | 原始资料和反链偏弱 | 投资框架完整 | 第二 | | DeepSeek V4 Pro | 报告完整 | Wiki 知识库 | 数据来源清单 | 投资框架完整 | 第三 | | DeepSeek V4 Flash | 报告完整 | Wiki 知识库 | 数据来源清单 | 投资框架完整 | 第四 | | Kimi K3 | 报告完整 | Wiki 知识库 | 数据来源清单 | 投资框架完整 | 第五 | ## 风险提示 - 模型输出结果基于历史数据和假设,不能代表未来。 - 市场环境变化可能导致模型失效。 - 交易成本或市场变化可能影响策略收益。 - 大模型输出存在随机性和准确性风险。 - 提示词变化可能导致输出结果不同。 - 使用需自行承担安全和版权风险。 ## 总结 - GLM-5.3 与 GLM-5.3-Flash 分别针对不同场景设计,前者适合深度与稳定性要求高的旗舰任务,后者适合低成本、多模态执行。 - 在估值任务中,GLM-5.3 表现最佳,具备完整的产品拆解、三表联动与敏感性分析,但部分假设需人工复核。 - 在回测任务中,GLM-5.3 数据链完整,但交易摩擦处理不足;GLM-5.3-Flash 样本期更长,但执行偏研究口径。 - 在行业研究任务中,GLM-5.3 公司覆盖广、数据更新及时,GLM-5.3-Flash 页面多但来源治理较弱。 - 评测结果仅供参考,实际应用需结合具体任务与执行框架进行验证。