华泰人工智能系列之十七:人工智能选股之数据标注方法实证-20190313-华泰证券-26页_2mb
报告摘要
金工研究:人工智能选股中的数据标注方法实证分析
核心内容
本文探讨了在人工智能选股中,不同数据标注方法对模型表现的影响,并通过实证分析对比了多种标注方法的回测效果。重点在于验证不同标注方法的有效性,并通过模型集成方法综合其优势。
主要观点
-
数据标注方法:
- 分类:股票收益排序,取前三分之一为“涨”,后三分之一为“跌”。
- 回归:使用标准化后的股票超额收益率作为标签。
- 夏普比率:使用标准化后的夏普比率作为标签。
- 信息比率:使用标准化后的信息比率作为标签。
- Calmar比率:使用标准化后的Calmar比率作为标签。
-
模型对比:
- XGBoost分类模型(XGBC)与回归模型(XGBR)相比,XGBR在大多数指标上表现更优。
- 使用夏普比率、信息比率、Calmar比率作为标签的模型(XGBR-Sharpe、XGBR-IR、XGBR-Calmar)分别在对应的指标上表现优于XGBR。
-
模型集成:
- 将XGBR、XGBR-IR、XGBR-Calmar进行等权集成,得到XGBR-Combine模型。
- XGBR-Combine在年化超额收益率、信息比率、Calmar比率等关键指标上表现最佳,且稳定性强。
-
回测表现:
- 在多个回测指标中,XGBR-Combine表现全面,优于单一模型。
- XGBR在信息比率上具有稳定优势,XGBR-Sharpe在夏普比率上表现更优,XGBR-IR在年化超额收益率上表现更优,XGBR-Calmar在Calmar比率上表现更优。
关键信息
-
测试方法:
- 使用随机数种子+多次测试方法验证模型的稳定性。
- 测试周期为2011年1月31日至2019年2月28日。
- 每个测试中,将股票池分为五层,等权配置,计算多空组合绩效。
-
数据处理:
- 数据预处理包括中位数去极值、缺失值填充、行业市值中性化、标准化。
- 使用82个因子进行测试,涵盖估值、成长、财务质量、杠杆、动量反转、波动率、股价、Beta、换手率等。
-
模型表现:
- XGBR:在多数指标上优于XGBC,尤其在因子收益率和夏普比率上。
- XGBR-Sharpe:在夏普比率上表现更优,但年化波动率无明显优势。
- XGBR-IR:在信息比率上表现更优,年化超额收益率更高,但跟踪误差略高。
- XGBR-Calmar:在Calmar比率上表现更优,年化超额收益率更高,但最大回撤无明显优势。
- XGBR-Combine:综合了三种模型的优点,在多个指标上表现最优。
回测指标对比
| 指标 | XGBC | XGBR | XGBR-Sharpe | XGBR-IR | XGBR-Calmar | XGBR-Combine |
|---|---|---|---|---|---|---|
| 年化超额收益率 | 14.13% | 16.32% | 16.62% | 16.94% | 17.22% | 18.22% |
| 信息比率 | 2.08 | 2.17 | 2.41 | 2.46 | 2.43 | 3.39 |
| Calmar比率 | 2.10 | 2.02 | 3.87 | 3.24 | 2.18 | 3.87 |
| 最大回撤 | 8.67% | 7.73% | 5.06% | 5.58% | 5.19% | 3.83% |
风险提示
- 人工智能模型构建的选股策略是历史经验的总结,存在失效风险。
- 模型可解释性较低,使用时需谨慎。
结论
本文通过实证分析,验证了多种数据标注方法的有效性,并展示了模型集成策略(XGBR-Combine)在多因子选股中的优势。模型在多个关键指标上表现优异,且稳定性强,为人工智能选股提供了有价值的参考。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载