20240328-国金证券-Alpha掘金系列之十_机器学习全流程重构——细节对比与测试_22页_2mb
报告摘要
金融工程专题报告摘要
本报告围绕机器学习在量化选股领域的模型训练细节展开详细分析,重点探讨了以下六个问题:
-
特征和标签的数据预处理:
- 截面模型(如GBDT)更适合使用整个训练集进行 ZScore 标准化,保留日期间的相对大小关系;
- 时序模型(如 GRU)则需对特征和标签分别进行 RobustZScore 或 CSRank 处理,以保留时序信息。
-
全A股票与成分股训练:
- 两种方式的优劣取决于指数(沪深300/中证500/中证1000)和模型类型(GBDT/GRU)。例如,GRU 在使用全A数据时效果更优,而 GBDT 在成分股训练中表现更好。
-
训练方式(一次性/滚动/扩展):
- 一次性训练对 GBDT 更有效;滚动和扩展训练在 GRU 上表现更稳健。
-
分类与回归模型:
- 回归模型(如 MSE 损失)在 IC 值和多空收益上均优于分类模型,保留数据的原始标签信息有助于提升效果。
-
损失函数是否修改为 IC:
- 不使用 IC 或其变体作为损失函数,能够获得与 MSE 相近甚至更优的结果,修改损失函数无显著提升。
-
集成方法(GBDT、DART、RF):
- 引入 Dropouts 思想的 DART 模型优于 GBDT,能有效缓解过拟合;随机森林表现较弱。
实验结果与策略应用
- GBDT 与 NN 结合后,在样本外效果上表现突出,合成因子 IC 均值分别为 1098%(沪深300)、1087%(中证500)和 1514%(中证1000)。
- 基于优化后的因子,构建指数增强策略:
- 沪深300:年化超额 1543%,最大回撤 287%;
- 中证500:年化超额 2050%,最大回撤 839%;
- 中证1000:年化超额 3225%,最大回撤 433%。
风险提示
- 历史数据回测结果存在时效性风险,市场政策变化可能导致模型失效;
- 交易成本增加或策略条件变动可能削弱策略表现。
关键结论
- 数据预处理需根据模型类型调整,时序与截面模型方法不同;
- 回归任务优于分类任务,MSE 为最佳损失函数;
- DART 集成算法显著提升模型泛化能力;
- GBDT 和 NN 合成因子在宽基指数成分股上效果最优。
(注意:本总结仅提取报告核心内容,未引用具体图表或公式)
免责声明:此内容为简化摘要,不代表完整分析,实际应用需结合风险评估和专业判断。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载