华泰人工智能系列三十二:_AlphaNet,因子挖掘神经网络-20200614-华泰证券-24页_2mb
报告摘要
AlphaNet: 因子挖掘神经网络
核心内容
本文提出了一种全新的因子挖掘神经网络 AlphaNet,旨在解决多因子选股中因子生成与合成的分离问题,实现端到端的因子挖掘与合成。AlphaNet 借鉴了遗传规划中的特征构建思想,结合了多种运算符函数作为自定义网络层,以提取股票量价数据中的特征。通过引入批标准化层 (Batch Normalization) 和池化层,AlphaNet 实现了特征的标准化与“模糊化”处理,从而提升了模型的训练效果和预测能力。
主要观点
- 深度学习的端到端能力:深度学习模型能够直接从原始数据中提取特征并进行预测,避免了传统多步骤模型中的人工干预和信息损失。
- AlphaNet 的结构:AlphaNet 包含四个主要部分:数据输入、特征提取层、池化层和全连接层。其中,特征提取层是关键部分,使用自定义运算符如
ts_corr,ts_stddev,ts_zscore等。 - 模型的有效性:在调仓周期为10天和5天的情况下,AlphaNet 合成因子在五因子中性化后,RankIC 均值分别为 9.54% 和 8.19%,显示出显著的增量信息。
- 策略表现:在行业市值中性的中证500增强策略中,AlphaNet-v1 在调仓周期为10天时,TOP组合年化超额收益率为 12.42%;在调仓周期为5天时,TOP组合年化超额收益率为 11.36%,且信息比率和夏普比率表现良好。
- 可解释性分析:使用 SHAP 值对 AlphaNet-v1 进行了可解释性分析,以评估合成因子的重要性与方向性。
关键信息
- 数据输入:个股量价数据以二维“数据图片”的形式输入,包含开盘价、收盘价、最高价、最低价、成交量、VWAP、换手率等。
- 特征提取层:包含
ts_corr,ts_cov,ts_stddev,ts_zscore,ts_return等自定义网络层,通过遍历时间与特征维度提取股票数据中的特征。 - 池化层:与CNN类似,对特征进行“模糊化”处理,以减少特征的复杂性。
- 全连接层:对提取的特征进行加权合成,对接预测目标。
- 测试方法:
- 单因子IC测试:评估因子的预测能力,结果显示 AlphaNet-v1 的 RankIC 均值分别为 9.54% 和 8.19%。
- 分层测试:在不计交易成本和计交易成本下,AlphaNet-v1 合成因子表现良好,TOP组合年化超额收益率分别为 12.42% 和 11.36%。
- 中证500增强策略回测:在不同权重偏离上限下,策略表现稳定,年化超额收益率分别为 16.44% 到 17.55%,夏普比率高达 7.28。
- 模型可解释性:SHAP 值分析表明,AlphaNet-v1 的因子具有明确的方向性和重要性,有助于模型的理解。
风险提示
- 通过人工智能模型构建的选股策略是基于历史数据的总结,存在失效的可能。
- 神经网络受随机性影响较大,使用时需谨慎。
- 模型解释方法可能存在过度简化的风险。
技术细节
- 模型构建:使用 Keras 框架,构建了 AlphaNet-v1 模型,包含一层特征提取层、一层池化层、一层全连接隐藏层。
- 训练与预测:模型每隔半年进行滚动训练,使用过去 1500 个交易日的数据作为样本内数据,按 1:1 划分训练集与验证集。
- 参数设置:
- 损失函数:均方误差 (MSE)
- 优化器:RMSSProp,学习率:0.0001
- Batch size:1000
- 提前停止:10
总结
AlphaNet 是一种创新的因子挖掘神经网络,其结构融合了遗传规划和深度学习的特征提取能力,能够有效处理股票量价数据,生成具有显著增量信息的合成因子。在调仓周期为10天和5天的情况下,合成因子在多因子中性化后表现良好,超额收益和夏普比率均优于基准。通过 SHAP 值分析,模型的可解释性得到提升,有助于理解因子的贡献。然而,模型的使用仍需谨慎,因其依赖历史数据,且存在失效和随机性风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载