华泰人工智能系列之二十七:揭开机器学习模型的“黑箱”华泰证券-33页_2mb
报告摘要
机器学习模型解释与XGBoost选股模型分析总结
核心内容
本文旨在探讨机器学习模型的解释方法,并以华泰金工XGBoost选股模型为例,揭示其“黑箱”特性。文章指出,尽管当前人工智能算法本质上仍是样本拟合,但其非线性拟合能力更强。由于资管行业的伦理需求,模型的可解释性至关重要。本文介绍了六种常用的机器学习模型解释方法,并分析了XGBoost模型在选股中的应用,揭示其因子选择和影响逻辑。
主要观点
-
机器学习模型的“黑箱”属性:
- 人工智能算法,包括深度神经网络和XGBoost,本质上仍是样本拟合,不具备真正的“智能”。
- 模型只能学习特征与标签的相关关系,无法挖掘因果关系,因此在应用时需要对其“思考”过程进行解释。
-
机器学习模型解释方法:
- 特征重要性:基于信息增益计算,适用于树模型,但不能体现方向性。
- ICE和PDP:考察特征对模型输出的影响,分别从单条样本和全体样本层面展示。
- SDT:使用单棵决策树解释复杂模型,直观但可能无法完全刻画模型复杂性。
- LIME:为单条样本构建简单代理模型,解释个体预测,但计算繁琐。
- SHAP:基于博弈论,计算特征对模型输出的边际贡献,理论完备且能展示特征交互作用。
-
XGBoost选股模型分析结果:
- 价量类因子重要性高于基本面类因子:XGBoost模型更重视价量类因子,如市值、反转、技术、情绪因子。
- 非线性因子表现突出:如X3因子,其对模型输出的影响呈现倒U型。
- 因子间存在交互作用:部分因子的边际贡献会因其他因子的变化而改变。
- 部分因子边际贡献为0:未来可以考虑剔除这些因子。
关键信息
-
模型构建步骤:
- 数据获取:全A股,剔除ST股、停牌股和上市三个月内的股票。
- 特征和标签提取:以沪深300指数为基准,计算个股超额收益。
- 特征预处理:中位数去极值、缺失值处理、行业市值中性化、标准化。
- 滚动训练:采用年度滚动训练,将数据分为9个阶段。
- 超参数调优:使用网格搜索选择验证集平均AUC最高的超参数。
- 模型测试:以2019年数据为测试集,使用回归法、IC分析法和分层回测法评估模型性能。
-
模型表现:
- XGBoost选股模型在20110201~20200203期间,年化超额收益为12.53%,跟踪误差为5.20%,信息比率为2.41。
- 2019年模型表现较一般,超额收益为3.59%,跟踪误差为5.34%,信息比率为0.67。
-
因子方向调整:
- 价量类因子(如市值、反转、技术、情绪因子)为反向因子,因子值越大代表越可能预测为“下跌”。
- 估值、成长、财务质量、杠杆(部分)、情绪、股东因子为正向因子,因子值越大越可能预测为“上涨”。
-
因子重要性分析:
- 2019年模型中,前10个因子重要性之和为0.47,接近全体因子的一半。
- 价量类因子主导前10名,如exp_wgt_return_6m、exp_wgt_return_3m、wgt_return_1m等。
- 基本面类因子如EP、BP、SP等排名靠后。
-
SHAP分析:
- SHAP值理论完备,能从全局和个体层面展示特征对模型输出的影响。
- SHAP值能揭示特征间的交互作用,例如X2和X3的交互影响。
- SHAP值在XGBoost模型中表现出较高的解释力,推荐使用SHAP进行模型解释。
风险提示
- 人工智能选股模型可能因未来市场规律变化而失效。
- 存在过拟合风险,模型在训练集表现良好,但在测试集可能不理想。
- 机器学习模型解释方法可能因简化而带来风险,需谨慎使用。
图表目录
- 图表1:模型解释方法总结
- 图表2:模拟因子值构建方式
- 图表3:模拟因子值及所属类别
- 图表4:XGBoost模型特征重要性
- 图表5:ICE和PDP示意图
- 图表6:X3因子对应“上涨”类别的ICE和PDP
- 图表7:X2因子对应“上涨”类别的ICE和PDP
- 图表8:全局代理SDT示意图
- 图表9:XGBoost模型SDT可视化展示
- 图表10:局部代理LIME示意图1
- 图表11:局部代理LIME示意图2
- 图表12:第1条样本的LIME
- 图表13:第50条样本的LIME
- 图表14:SHAP值简单案例
- 图表15:SHAP值计算实例
- 图表16:XGBoost模型“上涨”类别的|SHAP|均值
- 图表17:XGBoost模型“上涨”类别的各样本SHAP值
- 图表18:X1的SHAP值
- 图表19:X2的SHAP值
- 图表20:X3的SHAP值
- 图表21:X4的SHAP值
- 图表22:XGBoost选股模型净值
- 图表23:累计超额收益
- 图表24:人工智能选股模型测试流程
- 图表25:因子池及描述
- 图表26:年度滚动训练示意图
- 图表27:XGBoost模型超参数
- 图表28:2019年模型特征重要性
- 图表29:2019年模型5个因子PDP
- 图表30:2019年1月末In_capital因子ICE
- 图表31:2019年1月末exp_wgt_return_6m因子ICE
- 图表32:2019年1月末wgt_return_1m因子ICE
- 图表33:2019年1月末bias_turn_1m因子ICE
- 图表34:2019年1月末macd因子ICE
- 图表35:2019年模型SDT可视化展示
- 图表36:预测上涨概率最高个股的LIME
- 图表37:预测上涨概率最低个股的LIME
- 图表38:实际超额收益最高个股的LIME
- 图表39:实际超额收益最低个股的LIME
- 图表40:XGBoost模型|SHAP|均值
- 图表41:XGBoost模型SHAP值
- 图表42:In_capital因子SHAP值
- 图表43:exp_wgt_return_6m因子SHAP值
- 图表44:wgt_return_1m因子SHAP值
- 图表45:bias_turn_1m因子SHAP值
- 图表46:macd因子SHAP值
- 图表47:return_12m因子SHAP值
- 图表48:rating_change因子SHAP值
- 图表49:rating_average因子SHAP值
- 图表50:DP因子SHAP值
- 图表51:SP因子SHAP值
总结
本文全面介绍了机器学习模型解释方法,并以XGBoost选股模型为例,揭示了模型在选股决策中的逻辑。通过特征重要性、ICE、PDP、SDT、LIME和SHAP等方法,我们发现价量类因子在模型中占据主导地位,且XGBoost模型以非线性方式使用因子,部分因子存在较强的交互作用。SHAP作为理论完备的解释方法,能够从全局和个体层面展示特征对模型输出的影响,并揭示因子间的交互关系,推荐用于模型解释。然而,机器学习模型解释仍存在风险,需谨慎对待。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载