20250313-华安证券-_学海拾珠_系列之二百二十七_使用深度强化学习解决高维多期环境下的组合配置_23页_2mb
报告摘要
使用深度强化学习解决高维多期环境下的组合配置
核心内容
本文提出了一种基于深度强化学习(DRL)的投资组合配置框架,结合卷积神经网络(CNN)和WaveNet来提取资产价格动态特征和跨资产依赖关系,以解决高维多期投资组合优化问题。该框架旨在通过优化多期Bellman方程来实现长期投资组合的最优配置,并在不同持有期、风险厌恶系数、交易成本和金融指数下进行了实证测试,结果表明其性能优于传统方法和部分其他机器学习方法。
主要观点
- 传统方法的局限性:传统的投资组合优化方法如Markowitz均值-方差模型主要适用于单期优化,难以处理多期动态投资组合的复杂性和高维数据。
- DRL的优势:深度强化学习作为一种无模型的动态规划方法,能够通过与市场的实时交互学习最优策略,适用于多期动态投资组合配置。
- 模型结构:本文提出的模型(MP-Adv-DRL-Cor)包含三个部分:CNN用于提取资产价格的动态特征,WaveNet用于建模跨资产的依赖关系,DRL用于求解多期优化问题。
- 实证结果:实证结果显示,随着持有期的延长,投资组合的盈利能力提升,但波动率也相应上升。风险厌恶系数增加会降低交易频率和波动率,但可能牺牲收益和夏普比率。交易成本对盈利能力有显著影响,但不会增加风险。
关键信息
-
模型结构:
- CNN用于提取资产价格的序列信息。
- WaveNet用于建模资产之间的跨期依赖性。
- DRL(如确定性策略梯度DPG)用于求解多期Bellman方程,以获得最优投资组合策略。
-
投资组合约束:
- 预算约束:$\sum_{i=1}^{N} \omega_{i,t} = 1$
- 换手率约束:$TO_{i,t} = |\omega_{i,t} - \omega_{i,t-1}| \leq TO_t^{\max}$
- 箱型约束:$0 \leq \omega_{i,t} \leq \omega_i^{\max}$
-
目标函数与奖励设计:
- 奖励函数结合了资产收益和风险,并考虑了换手率和权重的约束,其形式为:
$$
u_t = \widehat{r}t - \lambda \sigma_t^2 - c_1 \sum{i=1}^{N} \max(0, TO_{i,t} - TO_t^{\max}) - c_2 \sum_{i=1}^{N} \max(0, \omega_{i,t} - \omega_i^{\max})
$$ - 参数 $c_1 = c_2 = 0.5$,$\lambda$ 设为 0.01,折扣率设为 0.98。
- 奖励函数结合了资产收益和风险,并考虑了换手率和权重的约束,其形式为:
-
超参数设置:
- 学习率:$2 \times 10^{-4}$
- 隐藏层数量:CNN 2层,WaveNet 7层
- 隐藏层大小:256
- 训练周期:1000个
- 回溯窗口大小:36
- 最大权重:0.7
- 最大换手率:0.5
-
实证方法:
- 使用了三个金融指数进行测试:S&P 100(100只股票)、DJIA(30只股票)、S&P/TSX(50只股票)
- 数据范围为2010年4月1日至2023年12月7日,分为训练集和测试集
- 对比方法包括:等权重(EW)、MP-CS-PPN-Cor、MP-DPG、SP-Adv-DRL-Cor
实证结果总结
| 持有期 $h$ | 年化收益率 (%) | 年化波动率 (%) | 夏普比率 | 最大回撤 (%) | 换手率 |
|---|---|---|---|---|---|
| S&P 100 | 1 | 12.48 | 0.508 | 39.80 | 0.007 |
| 5 | 25.72 | 0.890 | 39.19 | 0.087 | |
| 22 | 22.37 | 0.603 | 44.13 | 0.099 | |
| 36 | 29.21 | 0.808 | 32.09 | 0.170 | |
| 66 | 27.51 | 0.698 | 66.10 | 0.107 |
| 风险厌恶系数 $\lambda$ | 年化收益率 (%) | 年化波动率 (%) | 夏普比率 | 最大回撤 (%) | 换手率 |
|---|---|---|---|---|---|
| S&P 100, $h=5$ | 0.001 | 26.11 | 0.872 | 39.55 | 0.082 |
| 0.01 | 25.71 | 0.890 | 39.19 | 0.087 | |
| 0.1 | 21.25 | 0.902 | 31.17 | 0.021 | |
| 1 | 9.037 | 0.459 | 36.08 | 0.017 | |
| S&P 100, $h=36$ | 0.001 | 39.99 | 1.014 | 44.66 | 0.333 |
| 0.01 | 29.21 | 0.808 | 32.09 | 0.170 | |
| 0.1 | 27.91 | 1.074 | 31.64 | 0.064 | |
| 1 | 9.539 | 0.496 | 36.05 | 0.032 |
| 交易成本 $\xi$ | 年化收益率 (%) | 年化波动率 (%) | 夏普比率 | 最大回撤 (%) | 换手率 |
|---|---|---|---|---|---|
| S&P 100, $h=1$ | 0.05% | 12.32 | 0.502 | 39.82 | 0.007 |
| 0.5% | 10.56 | 0.430 | 40.00 | 0.007 |
投资组合方法比较
- MP-Adv-DRL-Cor:表现最优,尤其在较长持有期和较低风险厌恶下具有显著优势。
- MP-CS-PPN-Cor:表现良好,但在某些情况下(如DJIA指数在 $h=22$)表现较差。
- MP-DPG:在部分场景下表现不佳,可能由于其对动态市场适应性不足。
- SP-Adv-DRL-Cor:表现不如MP-Adv-DRL-Cor,但仍是基于DRL的方法。
- EW(等权重):在某些情况下(如 $h=1$)表现与机器学习方法相近,但不具备动态优化能力。
风险提示
- 文献结论基于历史数据和海外研究,不构成任何投资建议。
- 需要注意的是,交易成本对投资组合的盈利能力有显著影响,但不会增加风险。
- 风险厌恶系数的设置对投资组合的收益和波动率有重要影响,需在实际应用中进行仔细校准。
结论
本文提出了一种基于DRL的投资组合配置方法,结合CNN和WaveNet,有效提取资产价格动态和跨资产依赖性信息。实证结果表明,该方法在不同投资期限、风险厌恶系数和交易成本条件下均表现良好,尤其在中长期投资中具有优势。该方法为投资者提供了一种新的动态投资组合配置思路,有助于在复杂、高维和多期投资环境中实现更稳健的收益和风险控制。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载