20211019-德邦证券-德邦金工机器学习专题之一_利用机器学习捕捉因子的非线性效应_20页_2mb
报告摘要
金融工程专题总结
核心内容
本文探讨了如何利用机器学习方法挖掘股票收益与风格因子之间的非线性关系,并通过构建机器学习因子和机器学习残差因子来提升选股效果。研究基于CNE5模型,使用A股市场的数据,对多种机器学习模型进行了训练、调参和回测分析。
主要观点
- 非线性关系的存在:证券收益与风格因子之间不仅存在线性关系,还存在显著的非线性关系,这种非线性关系可以通过机器学习模型有效捕捉。
- 机器学习模型的应用:通过使用神经网络、提升树和随机森林等模型,能够更好地建模非线性关系,相较于线性模型,其在捕捉复杂关系方面表现更优。
- 集成模型的优势:通过集成多个机器学习模型的输出,可以有效降低噪音,提高模型的稳健性和预测能力。
- 模型稳定性:采用交错训练方式,可以避免模型在重训练时刻的不稳定性和高换手率问题,提升模型在样本外的表现。
- 因子重要性与交互效应:部分依赖曲线和因子重要性分析揭示了风格因子对机器学习因子的影响,尤其是流动性与非线性市值等因子具有较高的贡献度。因子间的交互效应也显著影响了模型的输出,是不可忽视的重要部分。
- 机器学习残差因子的构建:通过将机器学习因子对风格因子进行回归,取残差作为机器学习残差因子,该因子表现出较强的alpha特性,且在样本外具有稳定的超额收益。
- 因子表现评价:机器学习残差因子在多个维度(如t值、信息比率、最大回撤、月自相关系数等)均表现优异,且与其他因子线性不相关,具有较低的方差膨胀因子,说明其具备独立的选股能力。
关键信息
数据与模型
- 数据范围:使用2004年2月至2021年9月的全A市场数据,其中样本内为2009年2月至2014年12月,样本外为2015年1月至2021年9月。
- 训练方式:采用滚动训练法,每两年训练一次,每次回顾过去五年数据。
- 模型类型:包括神经网络、提升树和随机森林,其中随机森林表现较为稳定,集成模型表现优于单一模型。
回测结果
- 样本内表现:集成模型的平均信息系数(IC)高于单一模型,且模型稳定性较好。
- 样本外表现:交错训练的总集成模型在样本外表现良好,但2017年后第十组(多头)的超额收益不再显著,这可能与风格因子的失效有关。
- 机器学习残差因子:剔除风格因子线性影响后的残差因子在样本外表现稳定,具有显著的alpha特征,且在多个指标上优于其他因子。
因子特性
- 因子重要性:流动性与非线性市值是影响最大的两个因子,且具有较高的信息比率。
- 因子交互效应:不同因子的交互效应显著,例如非线性市值与贝塔、杠杆与非线性市值等组合表现出较强的交互效应。
- 因子稳定性:机器学习残差因子具有最低的波动率和最大回撤,且月自相关系数较低,表明其具有较好的稳定性。
风险提示
- 海外市场波动风险:市场波动可能影响因子的有效性。
- 宏观数据与政策变化风险:宏观环境和政策调整可能对因子表现产生影响。
- 模型失效风险:模型在特定市场条件下可能失效,需持续监控与调整。
附录
- 图表目录:包括模型训练流程、模型对比、因子重要性、交互效应、分组回测结果等。
- 参考文献:引用了MSCI、Barra等机构的研究成果,为模型构建提供了理论支持。
- 信息披露:分析师肖承志具有证券研究背景,独立完成本报告。
结论
本文通过引入机器学习模型,拓展了传统的多元线性回归框架,构建了一个具有显著alpha特性的机器学习残差因子。该因子在样本外表现稳定,具有较强的选股能力,能够有效捕捉风格因子之间的非线性关系。未来随着更多基础因子的加入,机器学习残差因子的选股能力有望进一步增强。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载