因子选股系列之九十五:DFQ强化学习因子组合挖掘系统-20230817-东方证券-39页_1mb
报告摘要
DFQ 强化学习因子组合挖掘系统总结
核心内容
DFQ 强化学习因子组合挖掘系统是一种新的因子组合生成框架,旨在通过强化学习优化因子生成器,从而生成一组具有协同效应的公式化 Alpha 因子。该系统结合了遗传规划算法的公式化优势与强化学习的泛化能力,同时提升了模型的运算效率。
系统由两个主要模块构成:
- Alpha 因子生成器:使用 Maskable PPO 模型生成动作,以 token 序列的形式生成公式化的 Alpha 因子。
- Alpha 因子组合模型:组合生成的 Alpha 因子,并通过奖励信号优化生成器。
这两部分通过交互不断优化,使得生成的因子组合在选股效力上表现优异。
主要观点
- 传统的 Alpha 模型通常单独挖掘每个因子,忽视了因子在组合中的协同效应。
- 强化学习模型能够适应市场变化,实现端到端学习,避免多个步骤和假设。
- PPO 算法通过限制策略更新幅度,提高训练稳定性,同时能够处理高维、复杂的数据。
- 使用 Transformer 模型作为特征提取器,相较于 LSTM 模型,具有更强的表达能力,但运算效率较低,GPU 可显著提升性能。
- 通过合成因子的 IC 作为奖励信号,优化因子组合的性能。
关键信息
数据与训练设置
- 训练集:2015.1.1-2018.12.31
- 验证集:2019.1.1-2019.12.31
- 测试集:2020.1.1-2023.6.30
- 因子挖掘频率:月频因子
- 模型训练:每个股票池选取 5 个不同的随机种子训练 5 个模型,最终输出为 5 个模型的合成因子值平均。
因子表现
- 沪深 300 股票池:
- 测试集 rankic 接近 $8%$,RANKICIR 接近 1(未年化),5 分组多头年化超额收益接近 $15%$。
- 中证 500 股票池:
- 测试集 rankic 达到 $8.5%$,RANKICIR 达到 1.15(未年化),5 分组多头年化超额收益达到 $8.22%$。
- 中证 1000 股票池:
- 测试集 rankic 达到 $11.4%$,RANKICIR 达到 1.38(未年化),10 分组多头年化超额收益达到 $13.65%$。
Top 组合表现
- 沪深 300 Top50 组合:
- 20 年以来年化超额收益近 $11%$,单边年换手 8 倍,最大回撤 $8%$。
- 2023 年到 8.7 号超额收益达到 $4.45%$。
- 中证 500 Top50 组合:
- 20 年以来年化超额收益超 $16%$,单边年换手 9 倍,最大回撤 $11%$。
- 2023 年到 8.7 号超额收益达到 $9.45%$。
- 中证 1000 Top50 组合:
- 20 年以来年化超额收益超 $15%$,单边年换手 10 倍,最大回撤 $16%$。
- 2023 年到 8.7 号超额收益达到 $4%$。
指数增强组合表现
- 沪深 300 指数增强组合:
- 20 年以来年化对冲收益近 $8%$,单边年换手 8 倍,最大回撤 $6%$。
- 2023 年到 8.7 号对冲收益达 $5.28%$。
- 中证 500 指数增强组合:
- 20 年以来年化对冲收益超 $11%$,单边年换手 9 倍,最大回撤 $8%$。
- 2023 年到 8.7 号对冲收益达 $5.59%$。
- 中证 1000 指数增强组合:
- 20 年以来年化对冲收益超 $8%$,单边年换手 10 倍,最大回撤 $11%$。
- 2023 年到 8.7 号对冲收益达 $1%$。
模型优势
- 强化学习因子优于人工因子和遗传规划因子,且市值偏向性低。
- 残差分析显示,强化学习因子与人工因子和遗传规划因子之间仍存在显著选股效果。
- 强化学习因子与神经网络因子存在信息差异,无法完全相互解释。
模型设计与优化
- 特征与算子:
- 共 70 个特征,包括日度量价、日内分钟量价、日内 I2 量价、基本面特征。
- 算子共 118 个,分为截面和时序两类,其中时序算子更复杂,出现频次较低。
- 表达式生成:
- 因子表达式采用逆波兰表达式(RPN)形式,便于解析。
- 表达式长度限制为 20 个 token,以提高可解释性。
- 因子池管理:
- 因子池容量上限为 200,防止模型复杂度过高。
- 当因子池达到上限时,新因子将替换掉权重最小的因子。
- 损失函数设计:
- 包含策略损失、值损失和熵损失。
- 引入 L1 正则化项防止过拟合。
- 考虑因子间的相关性,优化因子权重以减少冗余和提高多样性。
实验结果与效率
- 运算效率:
- 使用 Transformer 模型进行特征提取,GPU 可带来近百倍的加速。
- 通过保存因子表达式和值,减少重复计算,节省约 10 倍运算时间。
- 模型性能:
- 每个股票池训练总步数为 30 万步,运行时间在 3-6 小时之间,显著优于遗传规划模型。
- 模型在训练集、验证集和测试集上的表现稳定,且在不同股票池中均表现优异。
风险提示
- 量化模型失效风险:模型在极端市场环境下可能失效。
- 极端市场环境影响:市场剧烈波动可能对模型的稳定性产生影响。
总结
DFQ 强化学习因子组合挖掘系统通过将因子生成与组合优化结合,提升了选股效力和模型适应性。其使用 PPO 算法和 Transformer 模型,实现了高效的因子生成与组合优化。模型在沪深 300、中证 500 和中证 1000 股票池中均表现出色,具备良好的泛化能力和稳定性。此外,模型对人工因子和遗传规划因子均具有显著的提升效果,且在不同股票池中展现出较低的市值偏向性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载