> **来源:[研报客](https://pc.yanbaoke.cn)** # 视觉大模型ViT在量化选股上的探索总结 ## 核心内容概述 本文探讨了将视觉大模型ViT应用于量化选股策略的可行性,重点分析了其在信息增量、模型表现及与经典机器学习模型GBM的结合效果。通过将K线图作为输入,ViT模型输出高维向量,并尝试与GBM模型结合,以提升选股策略的表现。 ## 主要观点与关键信息 ### 1. ViT模型简介与优势 - **ViT架构**:ViT(Vision Transformer)是当前主流的视觉模型,相比CNN,其具备全局注意力机制,能捕捉更远的数据关系。 - **预训练优势**:ViT模型可通过下载预训练权重直接使用,无需从头训练,降低了实现门槛。 - **输入方式**:将股票过去60个交易日的K线图转换为 $384 \times 384$ 像素的图片,再切分为 $14 \times 14$ 的小方块,输入模型得到1152维向量。 ### 2. 图形作为信息增量的潜力 - **图形信息价值**:图形可能提供“看图一目了然”的信息,如技术形态,这些信息难以通过数值指标完全捕捉。 - **图形模型表现**:在与GBM模型的残差分析中,图形模型表现出显著的增量信息,尤其是在IC和ICIR指标上。 ### 3. 模型结构与训练设置 - **模型对比**:本文测试了三种模型(R0、R1、R2),其中R2包含更多图形信息,如副图数据。 - **训练时间与方式**:训练数据为2018-2021年,预测目标为未来20日股价,采用季度滚动训练。 - **权重设定**:使用1年半衰期的权重方式,以体现近期数据的优先级。 ### 4. 模型表现分析 - **IC与IR指标**:GBM模型的IC值为0.754,显著高于ViT模型,表明数值模型在精确性上具有优势。 - **残差模型表现**:ViT模型在残差部分表现优于简单的线性模型,但整体效果仍受制于高换手率和交易成本。 - **合成模型效果**:将ViT残差因子与GBM模型得分相加后,合成模型在多数年份表现优于GBM,尤其在限制换手后效果更佳。 - **2025年表现异常**:合成模型在2025年出现较大负超额,但通过因子极值中性处理后,超额收益趋于稳定。 ### 5. 合成模型的优化 - **换手控制**:限制换手在20倍以内,有助于减少交易成本,提升模型稳定性。 - **因子极值中性**:对动量和高波动因子进行极值中性处理,有效提升了模型的稳健性。 - **最终模型表现**:在不进行行业中性和换手控制的情况下,模型对中证500指数表现出良好的跟踪与超额收益能力。 ## 结论 - ViT模型在量化选股中具备一定的信息增量价值,尤其是在捕捉图形形态方面。 - 与GBM模型结合使用,通过残差合成,能够有效提升模型表现。 - 虽然ViT模型本身IC较低,但其在稳定性上的表现优于神经网络模型。 - 高换手率和交易成本是ViT模型在实际应用中需要克服的问题。 - 综合ViT与GBM,并加入因子极值中性约束,能够提升模型在多变市场中的适应性和收益表现。 ## 风险提示 - 模型基于历史数据构建,历史表现不代表未来。 - 市场环境变化可能导致模型失效。 - 图形信息量有限,无法完全替代数值模型。 - 投资者需结合自身风险偏好与承受能力,谨慎使用模型输出。