20260914-国金证券-大模型赋能投研系列之三十二_升级后Deepseek_V4.1Flash投研能力有多强_36页_4mb
报告摘要
DeepSeek V4.1 Flash 投研能力分析总结
核心内容
DeepSeek V4.1 Flash 是 DeepSeek 新一代模型结构系列中参数规模最小的成员,于 2026 年 9 月 10 日发布,原生支持多模态,支持 100 万 Token 上下文和最高 384K Token 输出。其在架构上采用非对称激活机制,输入端约 8B 参数,输出端约 16B 参数,显著降低主要算力开销。新一代注意力机制将缓存压缩至每 Token 890 字节,显存占用降至上一代的四分之一。在 API 用户端,DeepSeek V4.1 Flash 的缓存命中、输入和输出价格分别下降约 86.4%、77.3% 和 69.7%,成本优势明显。但本地部署门槛提升,权重增至约 510GB,需 8 卡节点支持,总拥有成本上升。
主要观点
- 能力提升集中于代码与智能体任务:DeepSeek V4.1 Flash 在七项公开测试中全部提升,其中代码生成与智能体任务的五项表现超过参数规模更大的 DeepSeek V4 Pro,但在科学知识与推理方面仍稍逊于 V4 Pro。
- 本地部署成本上升:虽然 API 成本下降,但本地部署所需显存增加,导致总拥有成本上升,适合对缓存命中率高的长任务,而不适合一次性生成任务。
- 金融投研任务表现:在估值、回测和行业研究任务中,DeepSeek V4.1 Flash 表现优异,但与 GPT-6 Astra 相比仍有差距,尤其在经营拆解与财务联动方面。
- 模型结构与交付质量:DeepSeek V4.1 Flash 交付结构完整的 Excel 模型和投资分析报告,但拆解颗粒度较粗,未设经营情景,检查独立性较弱。
关键信息
一、模型规格与成本
| 模型 | 总参数 | 激活参数(输入/输出) | 上下文长度 | 最大输出 Token | 输入价格(标准/错峰) | 输出价格(标准/错峰) |
|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash | 552B | 8B/16B | 1M | 384K | 0.006 / 0.003 美元 | 1.2 / 0.6 美元 |
| DeepSeek V4 Flash | 284B | 13B | 1M | - | - | - |
| DeepSeek V4 Pro | 1.6T | 49B | 1M | 384K | 0.044 / 0.022 美元 | 3.96 / 1.98 美元 |
| GPT-6 Astra | - | - | 1.05M | 128K | 1 美元 | 50 美元 |
| Kimi K3 | 2.8T | - | 1M | - | 0.3 美元 | 15 美元 |
| GLM-5.3 Flash | 320B | 18B | 1M | 128K | 0.03 美元 | 0.5 美元 |
二、金融投研任务表现
1. 估值任务
- DeepSeek V4.1 Flash:量价假设贯通底稿,报告与底稿一致,但拆解颗粒度较粗,未设经营情景,检查置于工作簿外。
- DeepSeek V4 Flash:模型联动完整,但报告以产品销量与单价驱动收入,实际由公司层增速驱动,存在敏感性分析表公式缺失问题。
- DeepSeek V4 Pro:报告逻辑自洽,但底稿不可复算,存在系统性公式错位。
- GPT-6 Astra:经营拆解与现金流分析最完整,工作簿内设来源管理与一致预期页,检查独立且全面。
- Kimi K3:报告逻辑自洽,但底稿存在静态值与公式错误,影响模型联动和复核。
2. 回测任务
- DeepSeek V4.1 Flash:数据校验与基准口径严谨,但交易成本、涨跌停与执行日约束缺失。
- DeepSeek V4 Flash:计入交易成本,但信号与执行时点存在偏差,未处理涨跌停约束。
- DeepSeek V4 Pro:次日成交并计入成本,但未处理涨跌停与执行日约束。
- GPT-6 Astra:区分信号与执行,完整模拟交易约束,历史时点与成交处理最完整。
- Kimi K3:三项交易约束均缺失,与真实交易差距最大。
3. 行业研究任务
- DeepSeek V4.1 Flash:知识库质量仅次于 GPT-6 Astra,但来源标注与评分复算不足。
- DeepSeek V4 Flash:覆盖较广,但未沉淀为知识库。
- DeepSeek V4 Pro:来源规范、评分可复算,但公司覆盖偏少。
- GPT-6 Astra:报告与知识库连成完整研究链,投资框架最为完整。
- Kimi K3:评分完整,但知识库沉淀与来源追溯最弱。
三、模型能力对比
| 模型 | 综合得分 | 估值任务 | 回测任务 | 行业研究任务 |
|---|---|---|---|---|
| GPT-6 Astra | 53 | 第一 | 第一 | 第一 |
| Kimi K3 | 44 | 第四 | 第四 | 第四 |
| DeepSeek V4.1 Flash | 40 | 第二 | 第二 | 第二 |
| DeepSeek V4 Flash | 35 | 第三 | 第三 | 第三 |
| DeepSeek V4 Pro | 36 | 第五 | 第五 | 第五 |
四、风险提示
- 模型结果基于历史数据,未来可能失效。
- 策略收益受交易成本和市场环境变化影响。
- 大模型输出存在随机性和准确性风险。
- 提示词变化可能导致输出结果不同。
- 使用 AI 生成内容需注意版权问题,用户需自行承担相关风险和后果。
总结
DeepSeek V4.1 Flash 在代码生成与智能体任务方面表现出色,但在科学知识与推理上仍需提升。其本地部署门槛提高,但 API 成本下降,适合高缓存命中率的长任务。在金融投研任务中,其估值建模和回测能力优于前代模型,但与 GPT-6 Astra 相比仍有差距。Kimi K3 在报告逻辑上表现较好,但底稿质量较差。DeepSeek V4 Pro 虽然报告结构完整,但存在系统性公式错误,影响可复算性。整体来看,DeepSeek V4.1 Flash 在模型能力、成本效益和任务完成度方面均表现优异,但在细节处理和独立检查方面仍有改进空间。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载