20160420-兴业证券-聪明的Alpha_万剑归宗_(上篇)_33页_1mb
报告摘要
详细总结:基于机器学习的SmartAlpha动态选股模型
核心内容
本报告基于前三篇报告中构建的SmartAlpha动态选股模型,进一步探索和革新了机器学习算法在选股中的应用,重点考察了决策树类算法,包括单棵决策树、随机森林和提升树模型。通过这些方法,构建了新的SmartAlpha因子,以提升选股效果并降低波动性。最终,基于表现优异的ISNRF_12M因子,构建了量化对冲选股策略,并取得了显著的超额收益。
主要观点
- 多因子选股体系:Alpha因子、风险模型和组合优化是现代多因子量化投资体系的重要组成部分,其中Alpha因子的构建是核心挑战。
- 机器学习算法的应用:通过引入决策树、随机森林和提升树等算法,对传统多因子模型进行改进,提升了模型的预测能力和稳定性。
- 模型优化方向:通过行业和市值中性化处理,降低因子波动性,提升风险调整后的表现。
- 策略表现:基于ISNRF_12M因子构建的量化对冲策略,年化超额收益率达14.40%,信息比率2.54,最大回撤仅4%。
关键信息
1. 决策树模型
- 因子构建:基于单棵决策树生成DT-12M因子,行业市值中性化后生成ISNDT-12M因子。
- 表现测试:
- DT-12M的RankIC平均值为5.95%,标准差为6.51%,IC_IR为0.91,t统计量为10.10。
- ISNDT-12M的RankIC平均值为5.77%,标准差为5.39%,IC_IR为1.07,t统计量为11.82。
- 分位数组合表现:
- 年化收益率在10%-38.65%之间,波动率在38.90%-43.37%之间,信息比率在0.31-1.55之间。
- 多空组合的Sharpe比率达1.39,信息比率显著。
- 换手率较高,平均为170%-178%。
2. 随机森林模型
- 因子构建:基于多棵决策树生成RF-12M因子,行业市值中性化后生成ISNRF_12M因子。
- 表现测试:
- RF-12M的RankIC平均值为9.31%,标准差为9.19%,IC_IR为1.01,t统计量为11.18。
- ISNRF_12M的RankIC平均值为9.04%,标准差为7.45%,IC_IR为1.21,t统计量为13.40。
- 分位数组合表现:
- 年化收益率在26.80%-43.48%之间,波动率在38.95%-40.25%之间,信息比率在0.58-2.22之间。
- 多空组合的Sharpe比率达2.91,信息比率显著。
- 换手率有所下降,平均为144.99%-177.80%。
3. 提升树模型
- 因子构建:基于AdaBoost算法生成BT-12M因子,行业市值中性化后生成ISNBT_12M因子。
- 表现测试:
- BT-12M的RankIC平均值为7.53%,标准差为6.95%,IC_IR为1.08,t统计量为11.96。
- ISNBT_12M的RankIC平均值为6.90%,标准差为5.79%,IC_IR为1.19,t统计量为13.17。
- 分位数组合表现:
- 年化收益率在13.28%-44.87%之间,波动率在39.04%-40.63%之间,信息比率在-1.97-1.81之间。
- 多空组合的Sharpe比率达2.53,信息比率显著。
- 换手率在153.77%-177.40%之间。
4. 选股策略
- 策略构建:以ISNRF_12M因子作为选股指标,构建量化对冲策略。
- 回测数据:
- 年化收益率为28.19%,高于中证500的12.19%。
- 年化波动率为39.15%,低于中证500的38.40%。
- Sharpe比率2.54,显著高于中证500的0.32。
- 最大回撤率为4%,优于中证500的69.27%。
- 胜率为60.00%,优于中证500的60.91%。
- 分年度表现:
- 2007年:策略收益率153.52%,基准130.88%,相对表现10.94%。
- 2008年:策略收益率-53.21%,基准-60.80%,相对表现17.26%。
- 2009年:策略收益率175.31%,基准131.27%,相对表现20.74%。
- 2010年:策略收益率12.42%,基准10.07%,相对表现2.12%。
- 2011年:策略收益率-25.07%,基准-33.83%,相对表现12.20%。
结构清晰的总结
1. 引言
- 多因子选股体系包括alpha因子、风险模型和组合优化。
- 前三篇报告构建了SmartAlpha因子,本篇报告继续深入挖掘机器学习算法用于选股。
- 本报告分上、下两篇,上篇重点分析决策树类算法。
2. 决策树模型
- 方法原理:将选股问题转化为二元分类问题,通过构建决策树对因子进行划分。
- 因子构建:DT-12M(单棵决策树)、ISNDT-12M(行业市值中性化)。
- 表现测试:RankIC平均值在5.95%-6.90%之间,信息比率显著,但波动性较高。
- 分位数组合表现:年化收益率在19.73%-38.65%之间,信息比率在0.31-1.55之间。
3. 随机森林模型
- 方法原理:通过构建多棵相互独立的决策树并进行聚合,提升预测能力。
- 因子构建:RF-12M(随机森林)、ISNRF_12M(行业市值中性化)。
- 表现测试:RankIC平均值达9.31%,信息比率更高,但波动性略有上升。
- 分位数组合表现:年化收益率在26.80%-43.48%之间,信息比率在0.58-2.22之间。
4. 提升树模型
- 方法原理:通过逐步修正错误分类的样本,构建多个决策树并进行加权融合。
- 因子构建:BT-12M(提升树)、ISNBT_12M(行业市值中性化)。
- 表现测试:RankIC平均值达7.53%,信息比率更高,同时保持低波动性。
- 分位数组合表现:年化收益率在13.28%-44.87%之间,信息比率在-1.97-1.81之间。
5. 选股策略
- 策略构建:以ISNRF_12M因子为基础,构建量化对冲策略。
- 策略表现:
- 年化收益率28.19%,超额收益率14.40%。
- 信息比率2.54,最大回撤4%。
- 胜率60.00%,优于中证500。
- 分年度表现:在2007-2011年期间,策略均优于基准,尤其在2008年和2009年表现突出。
附录
- 训练样本因子:包括多个传统因子和新生成的SmartAlpha因子。
- 图表:
- 图1:多因子投资体系
- 图2:基于AdaBoost算法的SmartAlpha模型流程图
- 图3-图25:展示各类因子的RankIC、信息比率、波动率、换手率等指标。
- 表格:
- 表1-表11:展示各类因子的RankIC、分位数组合表现、策略统计数据等。
本报告通过引入多种机器学习算法,构建了更优的SmartAlpha因子,显著提升了选股能力和风险调整后的表现,为量化投资提供了新的思路和方法。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载