20180725-华泰证券-华泰人工智能系列之十二_人工智能选股之特征选择_25页_1mb
报告摘要
人工智能选股之特征选择总结
核心内容
本文探讨了人工智能选股中特征选择的重要性及其对模型预测效果的影响,重点分析了不同特征选择方法在多因子选股中的表现。特征选择是机器学习数据预处理的关键步骤,其核心目的是从原始特征中选出一组优质子集,以提升模型的学习和预测效果,同时减少时间开销,避免过拟合,并增强模型的可解释性。
主要观点
-
特征选择的重要性:
- 特征选择有助于提升模型预测能力和选股策略表现。
- 特征数量并非越多越好,模型预测效果会随着特征数量的增加先上升后下降,存在一个最佳特征数。
- 特征选择本质上是一种降维手段,有助于提升模型开发效率。
-
特征选择方法分类:
- 过滤式方法:使用统计指标(如F值、互信息、卡方等)进行特征选择,计算简便,效率高,适用于监督和非监督学习。
- 包裹式方法:以基学习器的性能为依据,进行特征子集优化,但计算成本较高。
- 嵌入式方法:在训练过程中自动完成特征选择,如Lasso回归和基于树模型的方法。
-
常用特征选择方法:
- F值:用于衡量特征与标签的关联度,适用于分类和回归模型。
- 互信息:捕捉特征与标签之间的任意统计依赖性,适用于分类和回归问题。
- FPR/FDR/FWE:基于假设检验的错误率控制方法,用于筛选特征。
- 基于L1正则化的方法:如Lasso回归和线性SVM,能够自动筛选出重要的特征。
- 基于树模型的方法:如随机森林,通过特征重要性评估进行筛选。
-
特征选择对模型的影响:
- 对于逻辑回归_6m和XGBoost_6m,特征数在50左右时模型AUC达到峰值。
- 对于XGBoost_72m,特征数增加后AUC先上升后趋于稳定。
- 入选特征主要集中在动量反转、换手率和波动率等类别。
关键信息
-
特征选择方法:
- 过滤式:使用F值、互信息、卡方等指标,适用于监督和非监督学习。
- 基于FPR/FDR/FWE:通过控制错误率来选择特征,FDR和FWE更为严格。
- 基于L1正则化:通过惩罚系数控制特征选择的严格程度。
- 基于树模型:通过特征重要性筛选特征,适用于分类和回归问题。
-
特征选择测试结果:
- 特征个数对模型AUC有显著影响,存在一个最佳特征数量。
- 在测试中,使用F值和互信息作为统计指标时,特征选择方法对模型有明显的提升效果。
- 入选频次较高的特征以价量类因子为主,如动量反转和换手率因子。
-
特征预处理:
- 中位数去极值、缺失值处理、行业市值中性化、标准化等步骤是特征选择前的重要预处理手段。
- 预处理后的特征更接近标准正态分布,有利于模型训练和预测。
-
回测结果:
- 使用逻辑回归_6m、XGBoost_6m和XGBoost_72m作为基学习器,特征选择方法显著提升了模型的预测效果。
- 以沪深300和中证500为基准,特征选择策略在全A股选股中表现优于单一基学习器。
风险提示
- 模型依赖性:特征选择方法高度依赖基学习器的表现,若基学习器失效,特征选择方法可能随之失效。
- 过拟合风险:特征选择可能增加模型复杂度,存在一定的过拟合风险。
- 市场环境变化:特征选择基于历史数据,若未来市场环境发生变化,可能导致模型效果下降。
总结与展望
- 特征选择是提升模型性能的重要手段,尤其在面对海量因子时,能够显著提高模型开发效率。
- 本文测试了多种特征选择方法,发现基于F值和互信息的方法对逻辑回归_6m和XGBoost_6m有显著提升效果。
- 未来可进一步研究不同特征选择方法在不同市场环境下的适用性,并探索更复杂的特征选择策略以适应市场变化。
图表目录
- 图表1:特征选择主要方法
- 图表2:非监督式特征选择方法应用于模拟数据集
- 图表3:根据分类模型的F值对模拟数据集进行特征选择
- 图表4:根据回归模型的F值对模拟数据集进行特征选择
- 图表5:根据分类问题的互信息对模拟数据集进行特征选择
- 图表6:根据回归问题的互信息对模拟数据集进行特征选择
- 图表7:单个假设检验的输出结果
- 图表8:多重假设检验的输出结果
- 图表9:根据FPR/FDR/FWE进行特征选择的依据及严格程度
- 图表10:根据FPR/FDR/FEW对模拟数据进行特征选择
- 图表11:基于L1正则化的SVM对模拟数据集进行特征选择
- 图表12:基于随机森林模型对模拟数据集进行特征选择
- 图表13:特征选择方法测试流程示意图
- 图表14:选股模型中涉及的全部因子及其描述
- 图表15:特征选择方法的参数
- 图表16:测试集AUC随特征个数的变化情况
- 图表17:特征入选月份频次排名(前40名)
- 图表18:特征入选月份频次排名(后30名)
- 图表19:模型AUC和特征个数比较
- 图表20:回测指标对比(逻辑回归_6m为基学习器)
- 图表21:回测指标对比(XGBoost_6m为基学习器)
- 图表22:回测指标对比(XGBoost_72m为基学习器)
- 图表23:XGBoost_72m及其改进模型全A选股策略表现(个股权重偏离上限 $2%$,基准为沪深300)
- 图表24:XGBoost_72m及其改进模型全A选股策略表现(个股权重偏离上限 $2%$,基准为中证500)
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载