华泰人工智能系列之十二:人工智能选股之特征选择-20180725-华泰证券-25页-2mb
报告摘要
人工智能选股之特征选择总结
核心内容
本文探讨了人工智能选股中特征选择的重要性与应用,旨在通过特征选择提升模型预测效果,减少时间开销,并避免过拟合。特征选择作为数据预处理的关键步骤,对模型的泛化能力和可解释性有显著影响。文章主要围绕三种特征选择方法展开:过滤式、单变量特征选择、基于模型的特征选择,并结合实际数据对这些方法进行了测试和对比分析。
主要观点
-
特征选择并非越多越好:模型预测效果随着特征数的增加先上升后下降,尤其在逻辑回归_6m和XGBoost_6m中,特征个数在50左右时效果最佳。对于XGBoost_72m,特征数增加后AUC趋于稳定。
-
特征选择方法分类:
- 过滤式:依赖统计指标(如F值、互信息、卡方等),计算简便,适用于监督和非监督学习。
- 单变量特征选择:基于假设检验,如FPR、FDR、FWE,选择具有显著统计指标的特征。
- 基于模型的特征选择:如L1正则化、树模型(如SVM、随机森林)等,利用模型的输出结果(如回归系数、特征重要性)进行筛选。
-
特征选择对模型的提升效果:在实际测试中,F值和互信息方法对逻辑回归_6m、XGBoost_6m和XGBoost_72m的预测能力有明显提升,尤其是对AUC的改善效果显著。
-
特征入选频次分析:在滚动回测中,动量反转、换手率和波动率因子入选频次较高,而财务质量、杠杆因子入选频次较低。
-
模型构建与回测:以全A股为股票池,以沪深300和中证500为基准,构建行业中性和市值中性的选股策略。通过特征选择方法,模型的回测表现优于单一基学习器。
关键信息
-
特征选择的意义:减少时间开销、避免过拟合、提高模型泛化能力和可解释性。
-
常用特征选择方法:
- 过滤式方法:包括方差分析、卡方检验、互信息等。
- 单变量特征选择:基于统计指标和筛选标准(如F值、互信息、FPR/FDR/FWE)。
- 基于模型的特征选择:包括L1正则化和树模型(如SVM、随机森林)。
-
特征选择测试流程:
- 数据获取:全A股,剔除ST股、停牌股和上市3个月内的股票。
- 特征和标签提取:使用70个因子暴露度作为特征,下一自然月超额收益作为标签。
- 特征预处理:包括中位数去极值、缺失值处理、行业市值中性化、标准化。
- 训练与测试:使用逻辑回归_6m、XGBoost_6m和XGBoost_72m作为基学习器,通过交叉验证选择最优参数,进行样本外测试。
-
特征选择参数:
- 逻辑回归_6m:基于F值+K最优(K=60),基于互信息+K最优(K=60),基于F值+FPR(α=0.01)。
- XGBoost_6m:基于F值+K最优(K=60),基于F值+FDR(α=0.1)。
- XGBoost_72m:基于F值+K最优(K=60),基于F值+FDR(α=0.1)。
- 基于SVM:C=0.01(逻辑回归_6m)、C=0.08(XGBoost_6m)、C=0.003(XGBoost_72m)。
- 基于随机森林:阈值分别为0.9倍均值(逻辑回归_6m和XGBoost_6m)、0.92倍均值(XGBoost_72m)。
-
特征入选频次分析:在89个月的滚动回测中,动量反转、换手率和波动率因子入选频次较高,而财务质量因子入选频次较低。
-
模型回测表现:
- 使用逻辑回归_6m、XGBoost_6m和XGBoost_72m进行回测,发现特征选择方法对模型效果有提升。
- 对比测试显示,特征选择后的模型在AUC、收益等指标上优于未进行特征选择的模型。
风险提示
- 模型依赖性:特征选择高度依赖于基学习器的表现,若未来市场环境变化,可能导致模型失效。
- 过拟合风险:特征选择方法可能增加模型复杂度,存在一定的过拟合风险。
- 参数选择:特征选择方法中参数的选择对结果影响较大,需通过交叉验证确定最优参数。
未来展望
- 进一步研究特征选择对不同市场环境和基学习器的适应性。
- 探索更多特征选择方法,如嵌入式方法,以提高模型性能。
- 优化特征选择流程,提升模型在实际投资中的表现。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载