20170831-华泰证券-华泰人工智能系列之五:人工智能选股之随机森林模型_32页-2mb
报告摘要
随机森林模型在人工智能选股中的应用总结
核心内容
本文探讨了随机森林模型在多因子选股中的应用,分析其构建流程、参数优化及模型表现。随机森林是一种基于Bagging方法的集成学习模型,通过多个决策树的组合实现更优的分类和预测能力。
主要观点
- 随机森林模型的构建流程:包括特征和标签提取、特征预处理、样本内训练、交叉验证调参和样本外测试等步骤。最终在每个月底产生对个股下期涨跌概率的预测,用于构建选股策略。
- 模型优势:相比线性回归、支持向量机和朴素贝叶斯等模型,随机森林在超额收益和信息比率方面表现更优,但回撤控制相对较弱。
- 因子重要性:模型中市值和反转因子的重要性评分较高,表明它们在预测涨跌中起关键作用。
- 模型表现:在沪深300和中证500成分股内选股策略中,随机森林分别获得6.2%和8.4%的超额收益,而在全A选股中超额收益高达30.6%,信息比率达到4.17。
- 参数优化:通过网格搜索,确定最优参数为:树棵数 n=500,最大特征数 m=8,内部节点再划分最小样本数 s=50,叶节点最小样本数 l=10。
- 模型稳定性:随机森林相比单棵决策树更稳定,能有效降低过拟合风险。
关键信息
模型构建
- 特征提取:基于70个因子暴露度,包括估值、成长、财务质量、杠杆、波动率、情绪、技术指标等。
- 标签提取:使用沪深300指数作为基准,计算个股下月超额收益。
- 特征预处理:
- 中位数去极值
- 缺失值填充
- 行业市值中性化
- 标准化处理
- 测试流程:
- 采用7阶段滚动回测,即每年重新构建模型。
- 对不同股票池(沪深300、中证500、全A)进行测试。
- 使用正确率、AUC等指标评估模型表现。
参数敏感性分析
- 树棵数:随着树棵数增加,模型性能提升有限,最终选择 500 棵树。
- 最大特征数:选择 8 个特征以优化模型效率。
- 内部节点最小样本数:选择 50 个样本。
- 叶节点最小样本数:选择 10 个样本。
模型表现对比
- 正确率与AUC:
- 随机森林模型样本外平均正确率为 57.0%,平均AUC为 0.599。
- 12个月滚动线性回归模型样本外平均正确率为 53.8%,平均AUC为 0.568。
- 7阶段线性回归模型样本外平均正确率为 53.7%,平均AUC为 0.577。
- 超额收益:
- 沪深300成分股内选股:6.2%
- 中证500成分股内选股:8.4%
- 全A选股:30.6%
- 信息比率:
- 沪深300成分股内选股:1.74
- 中证500成分股内选股:2.16
- 全A选股:4.17
模型风险
- 风险提示:模型基于历史数据构建,存在失效风险,需持续关注。
模型特征重要性评分
- 市值(ln_capital)在2011-2017年期间始终是最重要的因子,重要性评分在 0.0299 左右。
- 动量反转(如exp_wgt_return_3m)是第二重要因子,重要性评分在 0.0239 左右。
- 其他因子如波动率、换手率、成长因子等在不同年份的重要性有所变化。
未来展望
- 随机森林模型在小盘股风格主导的时期表现优异,但在2017年后面临一定挑战。
- 需要进一步优化模型以应对市场风格变化,提升回撤控制能力。
总结
随机森林模型在多因子选股中表现出较强的预测能力和稳定性,特别是在市值和动量反转因子的影响下,能够有效提升超额收益和信息比率。模型构建过程涉及多个步骤,包括特征处理、参数优化和回测分析。虽然其在回撤控制方面存在不足,但其整体表现优于传统线性模型,为投资者提供了有价值的参考。未来需进一步研究和优化,以应对市场变化和提升模型效果。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载