20170911-华泰证券-华泰人工智能系列之六_人工智能选股之Boosting模型_41页_4mb
报告摘要
金工研究:Boosting模型在多因子选股中的应用分析
核心内容
本报告系统测试了三种Boosting集成学习模型(AdaBoost、GBDT、XGBoost)在多因子选股中的表现,重点分析了XGBoost模型的性能、参数优化和决策树结构。同时,报告还对比了这些模型与线性回归模型的性能差异,并讨论了模型构建流程、特征处理方法和回测策略。
主要观点
-
Boosting模型概述
Boosting模型通过串行组合弱学习器,能有效兼顾模型的偏差和方差。主要包含AdaBoost、GBDT和XGBoost三种,其中XGBoost是近年来Boosting领域的热门模型,具有更高的预测能力和更快的运算速度。 -
模型构建流程
- 特征与标签提取:使用70个因子作为特征,以个股下期超额收益作为标签。
- 特征预处理:包括中位数去极值、缺失值填充、行业市值中性化、标准化等。
- 模型训练与验证:采用7阶段滚动回测,将样本分为训练集、交叉验证集和样本外测试集。
- 模型评价:通过年化收益率、信息比率、最大回撤、AUC和正确率等指标评估模型表现。
-
XGBoost模型表现
- 在沪深300和中证500成分股内选股时,XGBoost的超额收益分别为6.4%和7.2%,信息比率分别为1.78和2.03。
- 在全A选股中,XGBoost的超额收益达到31.5%,信息比率高达4.4,显著优于线性回归模型。
- XGBoost在预测能力上与AdaBoost和GBDT相近,但运算速度更快,训练时间是其他模型的2~8倍。
-
模型比较
- 预测能力:三种Boosting模型的样本外平均AUC相近,分别为0.5695、0.5699和0.5696。
- 运行速度:XGBoost在训练速度上具有明显优势,适合大规模数据处理。
- 模型复杂度:Boosting模型比Bagging模型(如随机森林)更简单,决策树深度较低,树的数量较少。
-
参数优化
- 通过网格搜索优化XGBoost模型的
subsample和max_depth参数,最终选择subsample=0.95和max_depth=3作为最优参数。 - 其他参数(如
n_estimators、learning_rate等)无需优化,可使用默认值。
- 通过网格搜索优化XGBoost模型的
关键信息
选股策略表现
| 模型 | 沪深300成分股内 | 中证500成分股内 | 全A选股 |
|---|---|---|---|
| XGBoost | 超额收益:6.4% | 超额收益:7.2% | 超额收益:31.5% |
| 信息比率 | 1.78 | 2.03 | 4.4 |
| 最大回撤 | 与线性回归无明显优势 | 与线性回归无明显优势 | 与线性回归无明显优势 |
模型运行效率
| 模型 | 运行速度(相对) | 说明 |
|---|---|---|
| AdaBoost | 1 | 无显著优势 |
| GBDT | 1 | 无显著优势 |
| XGBoost | 1 | 明显优于其他Boosting模型 |
模型结构分析
- 所有模型均使用CART决策树作为弱学习器,最大深度为3。
- 第一个决策树均以
exp_wgt_return_3m(3个月加权动量因子)作为主要分裂因子,说明该因子对模型预测有较大影响。 - 后续分裂中,
turn_1m(1个月日均换手率)和ln_capital(对数市值)被多个模型共同选中。 - GBDT和XGBoost的第一个决策树使用的分裂因子一致,但分裂值不同,这与XGBoost是GBDT的高效实现有关。
回测与模型评价
- 回测区间为2011-01-31至2017-07-31,采用7阶段滚动回测方法。
- 模型评价指标包括:
- 正确率:XGBoost模型在样本外测试中达到54.02%。
- AUC:XGBoost模型样本外平均AUC为0.5696,优于线性回归模型的0.5512。
- 年化收益率、信息比率、最大回撤等指标用于评估不同策略的表现。
风险提示
- 通过Boosting模型构建的选股策略是基于历史数据的经验总结,存在失效风险。
- 模型在市场特征发生变化时,可能无法持续保持良好表现。
附录信息
- 因子池:包括估值、成长、财务质量、杠杆、市值、动量反转、波动率、股价、beta、换手率、情绪、股东等类别,共70个因子。
- 决策树结构:可可视化展示,有助于理解模型逻辑和优化模型。
图表目录摘要
- 图表1:集成学习算法的两大分支
- 图表2-3:AdaBoost串行方法与更新权值过程
- 图表4-6:AdaBoost、GBDT和XGBoost主要参数
- 图表7-9:XGBoost算法流程与模型构建示意图
- 图表10-12:因子描述与模型参数优化结果
- 图表13-15:模型样本外AUC值对比
- 图表16-18:模型决策树结构
- 图表19-21:因子重要性分析
- 图表22-25:分层回测绩效分析与净值对比
- 图表26-31:不同策略与因子组合的绩效指标分析
总结
本报告系统分析了Boosting模型在多因子选股中的应用效果,发现XGBoost模型在预测能力、信息比率和超额收益方面表现优异,尤其在全A选股中效果显著。同时,XGBoost在运算速度上具有明显优势,适合大规模数据处理。模型构建流程清晰,通过特征处理和参数优化,能够有效提升选股策略的稳定性与收益性。未来可进一步探索不同因子组合对模型性能的影响,以及模型在不同市场环境下的适应性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载