20210407-天风证券-海外文献推荐第175期_12页_1mb
报告摘要
金融工程:机器学习能用于基金组合构建吗?
核心内容
本文探讨了机器学习方法是否可以用于构建能够提供正向收益的共同基金投资组合。通过分析1980年至2018年美国股票型基金的数据,研究发现机器学习方法,尤其是梯度提升(GB)和随机森林(RF),在风险调整后能够提供显著的正向收益,而传统的线性回归方法(如OLS)和一些简单的投资策略(如等权重组合EW和资产加权组合AW)则表现较差。
主要观点
- 机器学习提升预测能力:机器学习方法可以利用多种基金特征信息,并允许预测因子与基金业绩之间存在非线性关系,从而提升预测能力。
- GB和RF表现突出:在所有算法中,GB和RF构建的基金组合在风险调整后的年回报率样本外高达4.2%,且其alpha在统计上显著。
- 非线性和交互作用的重要性:机器学习方法在捕捉基金特征与业绩之间的非线性和交互作用方面优于线性模型。
- 动态方法的必要性:基金特征和业绩之间的预测关系随时间变化,因此需要动态地重新评估模型。
- alpha随时间下降:所有投资组合的alpha在样本期内都会下降,这可能与资本市场竞争加剧和行业规模不经济有关。
关键信息
数据和预处理
- 数据来源:CRSP Survivor-Bias-Free US Mutual Fund数据库。
- 数据范围:1980年至2018年,覆盖6216只份额类别,其中5561只为综合型股票基金,665只为行业主题基金。
- 数据特征:包括月度收益、TNA、费用比率、换手率、年限、月流动量、流动量波动率、经理任期、资产增加值、Fama-French五因子模型和动量因子的回归结果。
- 预处理步骤:将数据从月度转换为年度,对特征进行标准化,并处理缺失值。
方法
- 基准方法:普通最小二乘法(OLS)。
- 机器学习方法:弹性网(EN)、随机森林(RF)、梯度提升(GB)。
- 超参数优化:使用k=5的交叉验证优化模型参数。
实证结果
- 组合表现:GB和RF构建的top10%基金组合在风险调整后具有显著的正向alpha,且其Sharpe比率和Sortino比率均优于其他方法。
- 多空组合:GB和RF相对于OLS的多空组合表现显著,而EN和OLS则没有显著差异。
- 不同模型评估:使用不同因子模型评估基金组合时,GB和RF仍表现出较好的性能,但在某些模型下显著性有所下降。
- 深度学习表现:使用最多3层的前馈神经网络(NN)进行预测,结果表明浅层网络(如NN1)优于深层网络(如NN3)。
变量重要度
- 没有单一特征在所有方法中占主导地位。
- GB和RF方法更依赖于市场beta,而OLS更依赖于动量beta。
- 变量重要度随时间变化,表明预测因子的相对重要性可能变化。
alpha随时间变化
- 所有投资组合的alpha在样本期内下降。
- GB方法在2000年代后期仍优于OLS,但自2015年以来两者表现趋于一致。
- 这一趋势与Jones和Mo(2020)的研究结果一致。
结论
- 机器学习方法在基金组合构建中具有显著优势,特别是在捕捉非线性和交互作用方面。
- 投资者,包括散户投资者,可以通过机器学习方法从主动管理基金中获益。
- 线性模型无法提供显著的正向alpha,而机器学习方法可以提供更好的投资组合表现。
图表目录摘要
- 图1:样本中各特征的描述性统计。
- 图2:目标变量与预测因子的相关系数矩阵。
- 图3:不同方法选择的基金组合的alpha。
- 图4:相对于OLS的多空组合表现。
- 图5:平均超额收益和风险指标。
- 图6:top5%和top20%组合的alpha。
- 图7:使用不同因子模型的组合alpha。
- 图8:仅考虑散户份额类别的组合alpha。
- 图9:使用神经网络的组合alpha。
- 图10:变量重要度。
- 图11:仅使用最重要的预测因子的组合alpha。
- 图12:滚动窗口下的组合alpha表现。
稳健性检验
- top5%和top20%组合:GB和RF方法在top5%组合中表现更好,但显著性下降。
- 其他因子模型:GB和RF方法在不同模型下仍表现良好,但显著性可能有所变化。
- 仅考虑散户份额类别:GB和RF方法在散户份额类别中表现更优。
- 深度学习方法:NN1表现优于NN3,表明浅层网络更适用于此问题。
风险提示
- 本报告基于相关文献,不构成投资建议。
- 投资者应独立评估报告内容,并考虑自身投资目的、财务状况和特定需求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载