金工:神经网络多频率因子挖掘模型-20230511-华泰证券-22页_1mb
报告摘要
神经网络多频率因子挖掘模型总结
核心内容
本文研究了基于神经网络的多频率因子挖掘模型,重点在于如何设计网络结构以有效提取不同频率的股票量价数据特征,并构建指数增强策略。通过对比不同模型的表现,发现引入日频数据和采用参数冻结+残差预测的增量学习模型能够显著提升选股效果。
主要观点
- 神经网络因子挖掘:神经网络能够自动提取股票原始量价数据中的特征,实现端到端的因子挖掘和合成,无需人工构建因子。
- 15分钟频模型:使用GRU网络处理15分钟频K线数据,在全A股样本空间中,周度RankIC均值为9.30%,年化超额收益率为24.18%(不计交易成本)。
- 注意力机制:尝试在GRU中加入注意力机制以增强对长序列信息的记忆,但测试结果显示未带来性能提升。
- 多频率混合模型:将日频与15分钟频数据结合,使用GRU分别提取特征并拼接输出,周度RankIC均值为8.58%,年化超额收益率为30.12%(不计交易成本),优于15分钟频模型。
- 多频率增量混合模型:采用两阶段训练方法,第一阶段训练日频数据,第二阶段冻结日频模型参数并学习15分钟频数据的残差信息。该模型表现最优,周度RankIC均值为10.22%,年化超额收益率为36.36%(不计交易成本)。
- 指数增强组合测试:基于多频率增量混合模型构建了沪深300、中证500、中证1000、国证2000等指数增强策略,表现优异,信息比率较高,年化超额收益率显著提升。
关键信息
模型结构与参数
- 15分钟频模型:使用GRU网络处理标准化后的15分钟K线数据,输入维度为6*320,输出维度为30,使用批标准化(BN)和全连接层(FC)。
- 多频率混合模型:使用两个GRU分支分别处理日频和15分钟频数据,输入维度分别为640和6320,输出拼接后通过全连接层输出预测值。
- 多频率增量混合模型:第一阶段使用日频数据训练GRU模型,第二阶段冻结日频分支参数,仅用15分钟频数据学习残差信息,提升模型表现。
回测结果
- 15分钟频模型:在沪深300、中证500、中证1000、全A股中,年化超额收益率分别为15.39%、17.33%、23.77%、24.18%。
- 多频率混合模型:年化超额收益率分别为29.25%、21.67%、30.12%、30.00%。
- 多频率增量混合模型:年化超额收益率分别为29.42%、26.53%、36.36%、36.36%。
指数增强策略表现
- 沪深300增强:在30%、40%、50%换手率下,年化超额收益率为8.77%~9.48%,信息比率为1.21~1.40。
- 中证500增强:年化超额收益率为17.39%~18.18%,信息比率为3.11~3.29。
- 中证1000增强:年化超额收益率为28.93%~31.57%,信息比率为4.45~4.79。
- 国证2000增强:年化超额收益率为29.38%~31.19%,信息比率为4.09~4.25。
模型对比与相关性分析
- 模型对比:多频率增量混合模型在各个股票池中表现最佳,TOP组合年化超额收益率和信息比率均优于其他模型。
- 模型相关性:四个模型之间的相关性分析显示,多频率增量混合模型与15分钟频模型、15分钟频注意力模型、多频率混合模型的相关性分别为0.5527、0.4576、0.7302,表明其具有较强的独立性。
风险提示
- 通过人工智能模型构建的选股策略基于历史数据,存在失效风险。
- 神经网络模型受随机性影响较大,可解释性差,使用需谨慎。
结论
本文通过构建基于GRU的神经网络模型,探索了不同频率数据对因子挖掘的影响。结果显示,多频率增量混合模型在模型效果和策略表现上均优于其他模型,能够有效提升指数增强策略的超额收益和信息比率。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载