深度报告-2026-04-01-西南证券-机器学习应用系列_T2RL_端到端深度强化学习因子挖掘与组合优化框架_36页_4mb
报告摘要
T2RL:端到端深度强化学习因子挖掘与组合优化框架总结
核心内容
本文提出了一种名为 T2RL(Two-stage Transformer Reinforcement Learning Framework)的量化选股框架,旨在解决传统深度学习模型在收益率预测与组合优化之间的断层问题。T2RL通过将 Transformer 与 强化学习(RL) 有机结合,构建了一个两阶段的模型:
- 第一阶段:使用融合 Transformer 与 Actor-Critic(AC)机制 的因子挖掘模型 TFAC,提取具备投资信号的因子,提升预测的准确性与方向性。
- 第二阶段:在 TFAC 提取的因子基础上,使用 基于Transformer的Soft Actor-Critic(SAC)模型(TFSAC),实现对投资组合权重的动态优化,从而达到收益最大化与风险控制的平衡。
T2RL实现了从个股预测到组合构建的完整闭环,为量化投资提供了新的方法论探索。
主要观点
-
传统方法的局限性:
- 传统深度学习模型主要关注收益率预测,但难以直接转化为投资组合的权重配置。
- 量化投资中,从因子预测到组合优化存在“断层”,即未能有效考虑收益与风险的平衡。
-
TFAC模型的优势:
- 融合 Transformer 的自注意力机制与 Actor-Critic 框架。
- 引入 方向准确奖励函数,确保模型不仅关注收益率的大小,也关注其方向的正确性。
- 在回测中,TFAC因子 RankIC 达到 0.1119,多头组合年化收益率 33.61%,优于传统Transformer模型。
-
TFSAC模型的创新点:
- 通过 TFAC 筛选出排名前N的股票,缩小动作空间,提高模型训练效率。
- 基于 对数收益 与 方差 构建奖励函数,实现收益与风险的动态平衡。
- 在不同调仓频率下,T2RL组合表现稳定,且在因子失效时仍能跑赢市场基准。
-
实证结果:
- 全A市场:T2RL在单日调仓下相对万得全A等权年化超额收益率达 50.36%,相对因子多头组合年化超额 31.06%。
- 沪深300指数成分股:T2RLHS300在单日调仓下年化收益率达 42.64%,相对沪深300年化超额 30.87%,在大多数年份跑赢基准。
- 中证1000指数成分股:T2RLZZ1000在单日调仓下相对中证1000年化超额收益率达 48.19%,在不同调仓频率下仍能保持显著超额收益。
关键信息
-
TFAC因子挖掘模型:
- 输入特征包括 开盘价、收盘价、成交量、技术指标、Barra风格因子 等。
- 回测显示其 RankIC 为 0.1119,优于传统Transformer模型的 0.0963。
- 多头组合年化收益率为 33.61%,超额收益在 2019-2026 年间平均为 17.09%。
-
TFSAC组合优化模型:
- 在 TFAC因子筛选 后,构建候选股票池,降低动作空间维度。
- 使用 SAC算法 在连续动作空间中学习权重分配策略,结合 对数收益 和 方差 构建奖励函数。
- 在不同调仓频次下,T2RL组合均能稳定跑赢基准和TFAC等权组合。
-
风险提示:
- 回测结果基于历史数据,存在数据滞后性、不准确或缺失的风险。
- 实际交易中可能面临 交易冲击 和 市场变化,回测不预示未来表现。
- 策略效果仅适用于回测区间,不能保证可持续性或收益。
未来展望
T2RL框架通过将深度学习与强化学习结合,实现了从因子挖掘到组合优化的端到端策略构建。未来可进一步探索 多因子协同优化、多市场适应性 以及 实时市场反馈机制,提升策略的鲁棒性与适应性。同时,可以考虑将 T2RL 应用于其他金融产品,如 基金、可转债、衍生品 等,拓展其应用场景。
相关研究
- 本文参考了多项量化投资与强化学习相关的研究,包括:
- OpenCaw:改变投资研究模式
- BLACK-LITTERMAN模型:融合资产择时与风格轮动
- ESG投资策略:跟踪量化多因子策略
- DDQN与SAC算法:在游戏控制、交通信号、能源调度等领域的应用
- 多周期嵌套下的风格轮动与多主线配置:2026年度资产配置策略
结构总结
| 模块 | 说明 | 回测表现 |
|---|---|---|
| TFAC因子挖掘模型 | 融合Transformer与Actor-Critic机制,提取投资因子 | RankIC 0.1119,多头组合年化收益率33.61% |
| TFSAC组合优化模型 | 基于Transformer的SAC模型,进行动态权重优化 | 单日调仓下年化超额收益率50.36%,2日调仓下24.68%,5日调仓下6.03% |
| 沪深300成分股组合 | T2RLHS300相对沪深300年化超额收益率30.87% | 单日调仓下年化收益率42.64%,分年度表现稳定 |
| 中证1000成分股组合 | T2RLZZ1000相对中证1000年化超额收益率48.19% | 单日调仓下表现最佳,5日调仓下仍保持27.35%超额收益 |
图表目录
- 图1:T2RL端到端框架结构
- 图2:Transformer网络结构
- 图3:Self-Attention机制
- 图4:Multi-Head Self-Attention结构
- 图5:马尔可夫决策过程
- 图6:策略函数与价值函数
- 图7:强化学习算法分类
- 图8:DDQN结构示意图
- 图9:Actor-Critic结构
- 图10:SAC结构
- 图11:TFAC模型结构
- 图12:TFAC因子IC序列
- 图13:TFAC因子分组净值
- 图14:TFAC多头分年度净值
- 图15:传统Transformer多头分年度净值
- 图16:TFSAC模型结构
- 图17:T2RL组合相对万得全A超额净值
- 图18:T2RL组合相对TFAC100超额净值
- 图19:T2RL组合分年度相对万得全A超额净值
- 图20:T2RL组合分年度相对TFAC100超额净值
- 图21:T2RLHS300相对沪深300超额净值
- 图22:T2RLHS300相对TFAC100HS300超额净值
- 图23:T2RLHS300分年度相对沪深300超额净值
- 图24:T2RLHS300分年度相对TFAC100HS300超额净值
- 图25:T2RLZZ1000相对中证1000超额净值
- 图26:T2RLZZ1000相对TFAC100ZZ1000超额净值
- 图27:T2RLZZ1000分年度相对中证1000超额净值
- 图28:T2RLZZ1000分年度相对TFAC100ZZ1000超额净值
表格目录
- 表1:深度学习模型时序特征列表
- 表2:TFAC因子回测结果
- 表3:TFAC因子10分组表现
- 表4:Transformer_AC因子多头分年度超额表现
- 表5:Transformer因子多头分年度超额表现
- 表6:不同调仓频次下的T2RL组合表现
- 表7:T2RL组合分年度表现—相对TFAC100组合
- 表8:T2RL组合分年度表现—相对万得全A等权指数
- 表9:TFAC因子沪深300回测结果
- 表10:T2RLHS300组合表现—沪深300
- 表11:T2RLHS300分年度表现—相对TFAC100HS300组合
- 表12:T2RLHS300分年度表现—相对沪深300指数
- 表13:TFAC因子中证1000回测结果
- 表14:T2RLZZ1000组合表现—中证1000
- 表15:T2RLZZ1000分年度表现—相对TFAC100ZZ1000组合
- 表16:T2RLZZ1000分年度表现—相对中证1000指数
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载