德邦金工机器学习专题之一:利用机器学习捕捉因子的非线性效应-20211019-德邦证券-20页_1mb
报告摘要
金融工程专题总结
核心内容
本报告探讨了如何利用机器学习方法捕捉线性因子模型中未被解释的非线性关系,通过构建机器学习因子和机器学习残差因子,进一步分析其在A股市场的选股能力。报告基于CNE5模型,使用2004年2月至2021年9月的全A市场数据,通过样本内和样本外的回测验证了模型的有效性。
主要观点
- 非线性关系的存在:证券收益与风格因子之间不仅存在线性关系,还存在未被线性模型捕捉的非线性关系,这些非线性关系可能带来显著的超额收益。
- 机器学习模型的应用:通过神经网络、提升树和随机森林等机器学习模型,可以有效拟合非线性关系,提高模型的预测能力。
- 模型集成的优势:集成多个机器学习模型可以降低噪音,提高预测的稳健性,且总集成模型优于单一模型。
- 模型稳定性:通过交错训练总集成模型,可以有效降低因重训练导致的高换手率问题,提高模型稳定性。
- 因子重要性与交互效应:部分依赖曲线和因子重要性分析表明,流动性、非线性市值等因子对机器学习因子具有显著贡献,且因子间的交互效应不可忽视。
- 机器学习残差因子:通过WLS回归剔除风格因子的影响,得到机器学习残差因子,其表现出显著的alpha因子特征,具有稳定的超额收益。
关键信息
1. 回测方法
- 每20个交易日调仓一次,样本内为2009年2月至2014年12月,样本外为2015年1月至2021年9月。
- 采用滚动训练方式,每两年训练一次,使用过去五年数据。
- 回测中使用市值等权策略,设定双边交易成本为0.3%。
2. 机器学习模型
- 使用神经网络、提升树、随机森林三种模型进行回测。
- 模型复杂度由参数调节,如神经网络隐藏层神经元数、提升树深度、随机森林树的数量等。
- 集成模型通过取不同复杂度模型的输出平均值,提高预测稳定性。
3. 模型表现
- 集成模型优于单一模型:集成模型在样本内和样本外均表现出更优的预测能力。
- 总集成模型最优:通过交错训练,总集成模型在样本外表现最优,且具有最小的月自相关性。
- 模型稳定性:总集成模型的逐月自相关系数较低,表明模型输出较为稳定。
4. 部分依赖曲线分析
- 通过PDP曲线,可以观察因子对模型输出的影响,揭示出具有经济学意义的非线性关系。
- 流动性与非线性市值是影响最大的两个因子,且其交互效应显著。
- 小市值溢价、盈利转向、低杠杆溢价等现象通过部分依赖曲线得到解释。
5. 因子重要性与交互效应
- 因子重要性通过PDP曲线极差计算,流动性与非线性市值的重要性较高。
- 因子交互效应通过三维曲面分析,揭示了不同因子组合对模型输出的影响。
- 交互效应在某些区域显著,如流动性与非线性市值的组合。
6. 样本外表现
- 交错训练的总集成模型在样本外表现良好,尤其在2015年至2017年间,第十组(多头)的超额收益显著。
- 2017年后,第十组的超额收益不再显著,可能与风格因子的变化有关。
- 机器学习残差因子在剔除风格因子影响后,依然表现出稳定的超额收益,具有显著的alpha因子特征。
7. 因子表现统计
- 使用WLS回归框架对机器学习残差因子进行统计分析,得到t值、因子收益率、收益波动率、信息比率、$R^2$增益、最大回撤、VIF、月自相关系数等指标。
- 机器学习残差因子具有较高的信息比率、较低的波动率和回撤,且与其他因子线性不相关,VIF等于1。
- 机器学习残差因子的年化超额收益率在样本外表现良好,尤其在2017年后,其超额收益相对稳定。
8. 因子分解
- 通过WLS回归将机器学习因子分解为风格因子的线性部分与非线性残差部分。
- 非线性残差因子即为机器学习残差因子,其具有独立的选股能力。
- 机器学习残差因子在样本外表现出较好的稳定性,且不依赖于市场风格变化。
风险提示
- 海外市场波动风险
- 宏观数据和政策变化风险
- 模型失效风险
参考文献
- Bonne, G., Wang, J., and Zhang, H., 2021. "Machine Learning Factors: Capturing Nonlinearities in Linear Factor Models"
- Menchero, J., Morozov, A., and Shepard P., 2010. "Global equity risk modeling"
- Orr, D. J., Mashtaler, I., Nagy, A. 2012. "The Barra China Equity Model (CNE5)"
- Cybenko, G., 1989. "Approximation by Superpositions of a Sigmoidal Function"
- Sutton, C. D., 2005. "Classification and regression trees, bagging, and boosting"
- Andy, L., Wiener, M., 2002. "Classification and regression by random forest"
分析师与研究助理信息
- 肖承志:德邦证券研究所首席金融工程分析师,同济大学应用数学硕士,6年证券研究经验。
- 研究助理:协助完成报告撰写与数据处理。
投资评级说明
- 投资评级基于报告发布后6个月内市场表现,分为买入、增持、中性、减持。
- 行业评级分为优于大市、中性、弱于大市。
法律声明
- 本报告不构成投资建议,不保证数据准确性。
- 报告内容仅反映发布当日的判断,可能随市场变化而调整。
- 德邦证券及其关联机构可能持有报告中提及的证券并进行交易。
信息披露
- 报告内容基于公开市场信息,不涉及内幕信息。
- 报告内容未经德邦证券研究所书面授权,不得复制、分发或引用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载