德邦金工文献精译第一期:机器学习因子,在线性因子模型中捕获非线性-20210917-德邦证券-20页_1mb
报告摘要
金融工程专题报告总结
核心内容
本报告探讨了如何利用机器学习(ML)技术来挖掘传统线性因子模型中未被捕捉的非线性关系和因子交互效应。通过结合线性模型的残差,构建非线性因子,研究显示ML因子在选股能力和投资组合表现方面具有显著优势。
主要观点
- 非线性关系的存在:证券收益与风格因子之间不仅存在线性关系,还存在显著的非线性关系,这为机器学习模型的应用提供了基础。
- ML因子的构建方式:采用线性回归模型得到残差后,使用ML模型对残差进行拟合,从而捕捉非线性关系。这种方法保留了线性模型的可解释性,同时利用ML模型捕捉复杂非线性效应。
- ML算法的选择与优化:研究中使用了提升树、随机森林和神经网络三种算法。结果显示,神经网络在预测性能上表现最佳,而集成模型通过平均多个模型的预测结果,有助于减少噪声并提高信号。
- 特征重要性与交互效应:动量和流动性是影响ML模型输出最重要的两个因子,它们的非线性效应显著。此外,因子之间的交互作用也对模型表现有重要影响,如动量与规模的交互效应。
- ML因子的绩效表现:ML因子在1998年至2020年期间,单独回测产生了约500%的多空收益回报;联合回测则产生了超过80%的回报。此外,ML因子在GEMTR风格因子中表现出最高的信息比率(IR)和因子回报。
- 模型稳定性与风险控制:模型的稳定性通过ML因子暴露的月度自相关性衡量,结果显示随机森林模型的稳定性最低,而提升树模型表现最佳。集成方法有助于降低模型对复杂性参数的敏感性,提高稳定性。
- 打开黑箱:通过部分依赖曲线、特征重要性和交互效应分析,研究揭示了ML模型内部的运作逻辑,增强了其可解释性。
关键信息
- ML因子构建框架:
- 使用GEMTR的22个风格因子作为输入。
- 回归模型中,将因变量设为标准化残差收益率。
- 通过集成多个ML模型的预测结果,提高因子的稳定性和性能。
- ML模型训练方法:
- 采用滚动训练框架,使用5年回顾期,每两年重新训练一次。
- 对输入特征进行标准化处理,以提高模型性能。
- 因子表现统计:
- ML因子在所有风格因子中表现出最高的信息比率(IR)和因子回报。
- 在横截面分析中,ML因子与其他风格因子的平均相关性接近于零,表明其具有较强的非线性特征。
- 风险提示:
- 海外市场波动风险。
- 宏观数据和政策变化风险。
- 模型失效风险。
方法与模型
- ML模型:包括神经网络、提升树和随机森林。
- 模型训练:使用标准化的因变量和输入特征,采用滚动窗口训练。
- 特征工程:对输入特征进行标准化处理,并评估不同特征的贡献。
- 模型集成:通过平均多个模型的预测结果,减少噪声并提高模型稳定性。
回测与评估
- 单因子回测:ML因子在1998年至2020年间产生了约500%的多空收益回报。
- 多因子回测:将ML因子加入GEMTR模型后,投资组合在该期间产生了超过80%的回报。
- 因子统计:在样本期内,ML因子表现出最高的IR和因子回报,同时具有较低的波动性,从而提升其整体表现。
结论
本研究证实了机器学习因子在捕捉非线性关系和因子交互效应方面的有效性。ML因子不仅在选股能力上表现出色,而且在多因子投资组合中也展现出显著的收益提升能力。尽管存在黑箱性质,但通过特征重要性、部分依赖曲线和交互效应分析,可以部分打开ML模型的“黑箱”,增强其可解释性。因此,使用ML技术构建的非线性因子可以成为投资者构建投资组合的重要工具。
附录
- ML算法描述:
- 神经网络:由多个层组成,通过激活函数和权重调整进行预测。
- 决策树:基于输入变量进行分割,适用于分类和回归问题。
- 随机森林:通过集成多个决策树来提高预测能力和减少过拟合。
- 提升树:通过迭代优化,逐步减少误差,构建强学习器。
风险提示
- 海外市场波动风险
- 宏观数据和政策变化风险
- 模型失效风险
投资评级说明
- 股票投资评级:
- 买入:相对强于市场表现20%以上;
- 增持:相对强于市场表现5%~20%;
- 中性:相对市场表现在-5%~+5%之间波动;
- 减持:相对弱于市场表现5%以下。
- 行业投资评级:
- 优于大市:预期行业整体回报高于基准指数整体水平10%以上;
- 中性:预期行业整体回报介于基准指数整体水平-10%与10%之间;
- 弱于大市:预期行业整体回报低于基准指数整体水平10%以下。
法律声明
- 本报告仅作为参考,不构成投资建议。
- 本报告信息来源于公开市场数据,不保证其准确性或完整性。
- 德邦证券及其关联机构可能持有报告中提到的公司所发行的证券,并提供相关服务。
分析师与研究助理简介
- 肖承志:德邦证券金融工程首席分析师,拥有6年证券研究经验,专注于市场择时、资产配置、量化与基本面选股。擅长使用扩散指标择时和机器学习模型,对隐马尔可夫模型有深入研究。
字数统计:约995字
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载