机器学习系列报告之二:机器学习合成非线性因子,增强效果如何?-20210312-申万宏源-42页_2mb
报告摘要
机器学习在多因子选股中的应用与效果分析
核心内容概述
本报告探讨了机器学习在多因子选股中的应用,分析了不同机器学习模型在合成因子与构建投资组合中的表现,并对因子的有效性、模型效果及市场适应性进行了评估。
主要观点
- 因子有效性随市场变化:传统的等权法与IC加权法在合成因子时各有优劣,但均无法捕捉因子之间的交互作用。机器学习能够更好地适应市场变化,挖掘非线性关系。
- 机器学习模型效果:在多头组合中,神经网络表现最佳,随机森林与XGBoost紧随其后;在空头组合中,基于决策树的集成模型表现较好,能有效控制波动率和回撤。
- 因子影响与相关性:合成因子与流动性、波动率相关性最高,与财务质量相关性最低。机器学习在技术面因子中表现优于基本面因子。
- 数据量与模型表现:模型效果高度依赖于数据量与特征数,样本池减少(如中证500)会显著影响机器学习模型的增强效果。
关键信息
1. 多因子选股理论与挑战
- 多因子模型:多因子选股已广泛应用于A股市场,涵盖基本面与技术面因子,如规模、估值、盈利、成长、反转、波动率、流动性、分析师一致预期等。
- 等权法与IC加权法:等权法简单直观,但无法体现因子差异;IC加权法能反映因子动量,但无法捕捉交互作用。
- 回测结果:多头组合在多数年份表现优于中证全指,但2017、2018年表现较差。
2. 机器学习选股框架
- 流程:包括数据准备、模型训练、参数调整、组合构建、模型评价等步骤。
- 数据准备:样本池为沪深全部A股,剔除ST及上市不满120天的股票;使用2010年1月至2020年12月的十大类风格因子。
- 模型训练:采用滚动窗口法(24个月),通过5折交叉验证选择最优参数,使用AUC作为评价标准。
- 参数调整:不同模型的参数含义与搜索范围各不相同,如逻辑回归的正则化参数,支持向量机的核函数与正则化程度等。
3. 机器学习模型表现
- 逻辑回归:IC中位数为12.96%,多头组合年化收益率为34.1%,夏普比率为1.26。
- 朴素贝叶斯:IC中位数为12.61%,多头组合年化收益率为35.0%,夏普比率为1.31。
- 支持向量机:IC中位数为12.76%,多头组合年化收益率为33.5%,夏普比率为1.24。
- 决策树:IC中位数为10.52%,多头组合年化收益率为32.8%,夏普比率为1.19。
- 随机森林:IC中位数为13.04%,多头组合年化收益率为35.2%,夏普比率为1.30。
- 梯度提升树:IC中位数为12.68%,多头组合年化收益率为34.5%,夏普比率为1.27。
- XGBoost:IC中位数为12.72%,多头组合年化收益率为35.2%,夏普比率为1.30。
- LightGBM:IC中位数为13.14%,多头组合年化收益率为35.5%,夏普比率为1.32。
- 神经网络:IC中位数为13.62%,多头组合年化收益率为35.5%,夏普比率为1.32。
4. 模型评价与因子分析
- 模型增强效果:多数模型在多头组合中表现优于等权法,但空头组合效果差异较大。
- 因子影响拆分:通过边际依赖函数可将单因子影响拆分为线性与非线性部分。神经网络对规模、流动性、盈利、成长因子的非线性影响较大,而分红、财务质量、分析师一致预期的线性影响占主导。
- 因子相关性:合成因子与流动性、波动率相关性最高,与财务质量相关性最低。
- 基本面 vs 技术面:机器学习在技术面因子中表现优于基本面因子,尤其是空头组合。
5. 样本池变化对模型的影响
- 全市场 vs 中证500:样本池减少显著影响模型效果,尤其在多头组合中,机器学习模型无法提升效果,但在空头组合中可一定程度提升表现。
- 数据量与特征数:模型效果依赖于数据量和特征数,数据不足时线性模型优于复杂模型。
总结
- 机器学习增强因子合成:能够捕捉因子间的非线性关系,提升多头组合表现,尤其在技术面因子中效果显著。
- 模型选择:神经网络、随机森林、XGBoost在多头组合中表现较好,而基于决策树的集成模型在空头组合中表现更优。
- 风险提示:机器学习模型依赖历史数据,市场环境变化可能导致模型失效。
参考文献
- 《量化投资新起点——机器学习系列报告之一》
- 《机器学习在量化金融中的应用》
- 《Scikit-learn: Machine Learning in Python》
风险提示
- 机器学习模型基于历史数据构建,无法保证未来表现。
- 市场环境变化可能导致模型失效,需持续监控与调整。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载