20250305-华安证券-_学海拾珠_系列之二百二十六_风险规避型强化学习模型在投资组合优化中的应用_14页_911kb
报告摘要
风险规避型强化学习在投资组合优化中的应用
主要观点:
本文提出了一种结合贝叶斯神经网络(BNN)和Dirichlet分布策略的强化学习框架,旨在解决投资组合优化问题。 计算机网络估计行动值函数,采用KL散度正则化项处理不确定性。 策略网络使用Dirichlet分布以探索受限行动空间。 在相同的1000步测试期间,该算法在风险规避和盈利能力上显著优于其他强化学习方法,如PPO和TRPO。
方法论:
模型基于马尔可夫决策过程(MDP),构建为受限MDP。 使用Actor-Critic架构,Critic网络为BNN以估计Q值和风险,Actor网络采用Dirichlet策略。 训练通过Replay buffer和Ornstein-Uhlenbeck噪声进行,引入VaR作为风险度量。 实证在每日数据上进行,涉及美国市场股票数据,回测显示风险降低18%。
实证结果:
实证结果表明,在样本外测试中,该算法的平均奖励和盈利更高,奖励标准差降至18%以下。 与其他方法相比,性能更优,尤其是风险控制方面。 探索使用Dirichlet分布样本控制连续行动空间。
结论:
该风险规避强化学习框架有效处理不确定性,提升了投资组合优化的稳健性。 传统金融方法如马科维茨理论局限于此,而该模型提供了一种灵活、自适应的决策工具。
风险提示:结论基于历史数据,非投资建议。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载