20220524-德邦证券-金工机器学习专题之五_基于模型池的机器学习选股_21页_2mb
报告摘要
金融工程专题:基于模型池的机器学习选股
核心内容
本文探讨了一种基于动态因子筛选和模型池维护的机器学习选股方法,旨在通过模型筛选和集成提升因子有效性与策略表现。核心内容包括:
- 模型池构建:通过定期训练模型并将其加入模型池,维护一个包含多种模型的集合,以提升模型的多样性和预测能力。
- 模型筛选机制:使用验证集对模型进行评分,筛选出表现较好的模型用于集成,提升策略的有效性。
- 因子筛选与构造:通过LGBM模型进行因子筛选,采用特征重要性排除低效因子,构建机器学习因子、反转因子和复合因子。
- 模型性能评估:通过回测分析模型在不同时间范围和频率下的表现,发现长记忆模型池优于短记忆模型池,模型训练频率为每季度为佳。
- 模型异质性:模型之间预测值相关性低,有利于构建更有效的集成模型。
- 因子表现差异:因子在全市场和小市值股票池中表现良好,但在大市值股票池中效果有限。
- 策略回测结果:全市场分十组回测显示策略表现优于基准,超额收益稳定,信息比率较高;中证1000分五组回测结果也显示出较好的超额收益和稳定性。
主要观点
- 采用LGBM模型替代随机森林模型,显著提高运算效率,同时保持筛选效果。
- 模型池通过持续训练与筛选,保留过去训练的模型,实现对市场风格和因子轮动的适应。
- 长记忆模型池优于短记忆模型池,因为更早的模型拥有更长的市场记忆,整体表现更优。
- 模型训练频率不宜过高,每季度训练一次在回测中表现最佳,能有效降低运算成本。
- 验证集时间长度对模型表现影响较小,但不宜过短,以过去一年为验证集较为合理。
- 模型异质性良好,预测值之间的相关性低,有利于构建更稳健的集成模型。
- 复合因子表现最优,其Rank ICIR达到1.083,优于机器学习因子和反转因子。
- 因子库质量有待提升,部分财务因子处理方式简单,未来将通过优化因子库提高策略表现。
关键信息
因子筛选机制
- 因子预筛选:通过LGBM模型的特征重要性排除低相关性因子,加快筛选效率。
- 边际筛选:逐个筛选有效因子,提升因子池整体质量。
- 筛选频率:每隔一定数量($N_s$)个月进行一次因子筛选,以降低过拟合风险。
- 因子类型:包括风格因子、财务因子(如利润表、资产负债表、现金流量表相关因子)等。
模型池构建与筛选
- 模型池要素:模型类型、模型参数、数据时间范围、因子种类列表。
- 模型筛选:使用验证集(通常为最近12个月)进行打分,筛选出表现最好的25%模型用于集成。
- 模型训练频率:每3个月训练一次模型表现最佳,能有效降低运算资源消耗。
- 模型有效性跟踪:模型在刚训练时有效,但随着时间衰减,部分模型在后期重新变得有效,显示模型有效性具有轮动性。
机器学习因子构造
- 机器学习因子:通过LGBM模型对当前因子池进行预测,计算RankIC。
- 机器学习反转因子:基于上个月的预测值与实际残差收益率进行对比,构造反转因子。
- 复合因子:结合机器学习因子和反转因子,通过z-score标准化并取正负部分相加,提升整体表现。
回测与性能指标
- 全市场分十组回测:超额年化收益率为18.6%,信息比率为2.41,多空收益和多头超额收益稳定。
- 中证1000分五组回测:超额年化收益率为16.3%,信息比率为2.092,表现稳健。
- 收益归因:约10.9%的收益来自特质回报,4.9%来自风格回报,行业回报较低。
- 策略表现:长记忆模型池表现优于短记忆模型池,模型池的起始时间对策略整体表现有显著影响。
风险提示
- 市场风格变化风险:模型的有效性受市场风格影响,可能出现轮动效应。
- 模型失效风险:模型在训练后可能随时间衰减,需持续跟踪和筛选。
- 数据可用性风险:模型依赖历史数据,若数据质量或可用性不足,可能影响模型效果。
结论
本文提出了一种基于模型池的机器学习选股方法,通过动态筛选因子和模型,构建复合因子以提升策略表现。模型池的构建与维护显著提高了模型的效率和稳定性,尤其在全市场和小市值股票池中表现良好。尽管在大市值股票池中效果有限,但通过改进因子库和模型合成方法,未来可进一步提升策略表现。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载