金工机器学习专题之二:机器学习残差因子表现归因-20211124-德邦证券-16页_1mb
报告摘要
金融工程专题总结
核心内容
本文探讨了机器学习残差因子在全市场选股中的应用及表现,旨在通过非线性建模方法弥补传统多元线性回归模型的局限性。研究基于CNE5中的十个风格因子,通过加权线性回归计算残差收益率,并使用神经网络、随机森林和提升树三种机器学习模型拟合该残差收益率,构造出机器学习残差因子。该因子对风格因子进行了正交化处理,从而去除风格偏好,专注于特质选股能力。
主要观点
-
线性模型的局限:传统线性回归模型在解释因子与股票回报关系时存在以下问题:
- 回报与因子之间的关系可能为非单调。
- 因子对回报的敏感性可能不是常数。
- 不同因子之间可能存在交互效应,且其影响可能依赖于其他因子的取值。
-
机器学习残差因子的构建:
- 通过机器学习模型拟合残差收益率,以捕捉非线性效应。
- 使用集成、交错训练等方法避免过拟合。
- 通过正交化处理风格因子,构造出机器学习残差因子。
-
机器学习残差因子的选股能力:
- 该因子在全市场选股中表现出较强的选股能力,其暴露最高的组具有显著的超额收益。
- 与风格因子线性不相关,因此不体现风格偏好。
- 超额收益主要来源于特质选股能力,且该能力在回测期间表现稳定。
-
不同股票池的选股效果:
- 在沪深300和中证500成分股中选股效果不佳,这与这些股票定价的有效性相关。
- 小市值股票池中,机器学习残差因子表现出较好的选股能力,且具有更高的超额收益。
-
策略容量测试:
- 假设每只股票日交易额的10%为最大交易量,测试了不同资金量下的超额收益。
- 初始资金量从1亿到500亿不等,结果显示即使资金量较大,超额收益仍较为可观。
- 组合具有较低的换手率,有利于降低交易成本并提高调仓完成度。
-
双因子分组方法:
- 通过机器学习残差因子与风格因子组合进行分组,提升选股能力。
- 在高机器学习因子暴露的股票池中,多个风格因子表现出较强的选股能力,如小市值、低流动性、高贝塔等。
关键信息
- 机器学习模型:神经网络、随机森林、提升树。
- 因子暴露计算:使用加权线性回归,权重为股票市值的四分之一次方。
- 归因分析:
- 行业归因:第十组(因子暴露最高)的行业主动暴露普遍较小,超额收益主要来自特质选股。
- 风格归因:非线性市值因子带来最大的超额收益,流动性因子带来一定的损失。
- 容量测试:
- 初始资金量从1亿到500亿,组合的年化收益率随着资金量增加而略有下降。
- 调仓完成度(η)随资金量增加而下降,但整体仍能较好地代表策略。
- 回测区间:2012年12月至2021年11月。
- 投资组合构成:
- 主要由沪深300、中证500以外的小市值股票构成。
- 小市值股票贡献了最多的收益和超额收益。
风险提示
- 海外市场波动风险。
- 宏观数据与政策变化风险。
- 模型失效风险。
附录信息
- 分析师信息:肖承志,德邦证券研究所首席金融工程分析师,同济大学应用数学硕士,6年证券研究经验。
- 研究助理:相关研究包括《机器学习因子:在线性因子模型中捕获非线性》和《利用机器学习捕捉因子的非线性效应》。
- 投资评级说明:
- 股票投资评级分为买入、增持、中性、减持。
- 行业投资评级分为优于大市、中性、弱于大市。
- 评级基于相对市场表现,不构成具体投资建议。
图表目录(关键结果)
- 图1:全市场选股分组回测结果。
- 图2:全市场选股组10回报的行业和风格归因。
- 图3:全市场选股组10回报的指数成分归因。
- 图4:全市场选股容量测试,各组净值曲线。
- 图5:全市场选股容量测试,各组超额收益曲线。
- 图6:调仓完成度与资金量的关系。
- 图7:沪深300指数成分股选股回测结果。
- 图8:中证500指数成分股选股回测结果。
- 图9:沪深300、中证500成分股以外选股回测结果。
- 图10:双因子分组回测结果。
表格目录(关键数据)
- 表1:行业平均主动暴露及年化超额收益率贡献。
- 表2:因子平均主动暴露及年化超额收益率贡献。
结论
机器学习残差因子在全市场选股中表现出较强的选股能力,其超额收益主要来源于特质选股,且在不同时间段保持稳定。然而,在大市值和中市值股票池中选股效果不佳,这可能与这些股票定价的有效性有关。为了提高选股能力,应从因子输入层面进行优化。此外,该因子不具有风格偏好,但可以与风格因子结合进行双因子分组选股,从而获得更优的选股效果。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载