华泰人工智能系列之二十八:基于量价的人工智能选股体系概览华泰证券-24页_2mb
报告摘要
基于量价的人工智能选股体系总结
核心内容
本文构建了一套基于量价信息的全流程人工智能选股体系,该体系包含以下三个关键步骤:
- 遗传规划自动挖掘因子:利用遗传规划从原始量价数据中自动挖掘选股因子,支持线性因子和非线性因子的挖掘。
- 机器学习模型进行多因子合成:使用随机森林模型进行因子合成,以增强模型的非线性拟合能力,同时通过特征选择和时序交叉验证来缓解过拟合问题。
- 机器学习模型的可解释性分析:采用SHAP值方法对模型进行解释,提升模型的可理解性,增强投资者对模型的信任。
主要观点
- 人工智能在多因子选股中的应用:人工智能技术能够有效融入多因子选股模型的因子生成和多因子合成环节,为传统模型提供增量信息。
- 量价信息的优越性:量价信息具有海量数据和高维度特征,是AI技术最适合应用的领域之一。
- 因子挖掘的优化:通过定义不同的适应度指标(如RankIC和互信息)挖掘不同类型的因子,同时采用残差收益率作为预测目标,提升因子挖掘效率。
- 模型的强拟合与过拟合的平衡:引入特征选择和时序交叉验证,以在提升模型性能的同时避免过拟合。
- 模型可解释性的重要性:SHAP值方法能够揭示因子对模型输出的贡献,有助于理解模型决策逻辑。
关键信息
步骤1:遗传规划自动挖掘因子
- 因子适应度定义:使用RankIC挖掘线性因子,使用互信息挖掘非线性因子。
- 增量信息挖掘:通过残差收益率作为预测目标,减少因子正交化带来的计算负担。
- 因子挖掘效率提升:采用并行计算和高性能语言/程序包(如Bottleneck)提高计算效率。
步骤2:机器学习模型进行多因子合成
- 模型选择:采用随机森林模型,其具备非线性拟合能力和嵌入式特征选择功能。
- 特征预处理:包括中位数去极值、行业市值中性化、标准化等。
- 调参方法:使用时序交叉验证优化模型的三个关键参数(决策树数量、分裂特征比例、最大深度)。
步骤3:机器学习模型的可解释性分析
- 可解释性工具:使用SHAP值分析模型的特征重要性和方向。
- SHAP值分析:能够揭示因子对模型输出的边际贡献,帮助理解模型决策过程。
测试结果
- 单因子IC测试:合成因子进行五因子中性化后的RankIC均值为8.87%,IC_IR为1.16。
- 分层测试:TOP组合年化超额收益率为9.65%,信息比率为3.08,多空组合年化收益率为28.20%。
- 中证500增强策略:使用合成因子后,年化超额收益率平均提升1.38%,信息比率平均提升0.14。
- SHAP值分析:随机森林模型有效利用了遗传规划挖掘出的线性和非线性因子,验证了模型的可解释性。
结论
本文构建的基于量价的人工智能选股体系在测试中表现出良好的性能,能够提供独立于传统多因子模型的增量超额收益。体系包括因子挖掘、因子合成和模型解释三个步骤,各步骤均采用优化方法,提升了模型的有效性和可解释性。未来,华泰金工将继续完善该体系,并探索更多AI技术在量化投资中的应用。
风险提示
- 人工智能选股策略是基于历史数据的总结,存在失效风险。
- 遗传规划挖掘的因子可能过于复杂,可解释性较低。
- 机器学习模型存在过拟合风险。
- 模型解释方法可能过于简化,无法完全反映真实情况。
附录简介
- 核主成分分析(KPCA):用于非线性降维,通过核函数将数据映射到高维空间,实现线性可分后再进行PCA降维。
- 常用核函数:包括线性核、多项式核、Sigmoid核和高斯核(RBF核)。
- Bottleneck程序包:用于加速Python中的矩阵运算,提升因子挖掘效率。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载