【东南大学】2024适于电力系统的深度强化学习方法探索报告_3页_10mb
报告摘要
张翔昱研究报告总结
核心内容概述
张翔昱的研究聚焦于电力系统中复杂、多步决策优化问题的解决,尤其是针对具有强时序相关性的场景。他提出两种基于强化学习的方法:两阶段“全局-局部”策略搜索方法和基于课程学习的策略搜索方法,以解决传统优化方法在实时性和复杂性上的不足。
主要观点
1. 传统优化方法的局限性
- 模型预测控制 (MPC):具有最优性保障和显式约束表达式,但系统模型可能需简化,且需要实时计算。
- 学习辅助型优化求解:包括值函数学习、学习加速型ADMM和可微规划等,这些方法在一定程度上可以提升优化效率,但仍存在收敛性和计算量的问题。
2. 学习型优化方法的优势
- 快速实时响应:无需复杂系统模型,适用于高不确定性场景。
- 端到端优化:能够直接从数据中学习策略,适应复杂问题。
- 部署灵活:可部署在“边缘-云计算”协同控制框架中,实现数据→模型→决策的闭环。
关键信息
1. 两阶段“全局-局部”策略搜索方法
- 目标:解决电力系统中多步决策问题,提高策略训练效率。
- 方法:
- 第一阶段:全局搜索:采用基于零阶梯度估计的ES-RL算法,具有高度并行性和快速梯度估计。
- 第二阶段:局部微调:采用Proximal Policy Optimization (PPO),基于原目标函数的梯度进行策略更新,具有更强的局部搜索能力。
- 优势:
- 平衡全局探索与局部优化。
- 提高策略的鲁棒性和收敛性。
- 应用案例:在智能建筑空调需求响应控制中,通过该方法实现对多热力分区的优化控制。
2. 基于课程学习的策略搜索方法
- 目标:用于配电网关键负荷恢复(CLR)问题,解决新能源发电不确定性带来的挑战。
- 方法:
- 课程学习:设计不同难度的训练课程,逐步提升策略的鲁棒性。
- 课程合成:通过考虑预测误差和实际发电数据,合成不同误差等级的训练数据。
- 优势:
- 提高策略在不确定性环境下的表现。
- 通过分阶段训练,降低训练难度,提升学习效率。
- 实验设置:
- 使用NREL的新能源发电数据。
- 评估不同误差等级下的策略性能。
研究亮点与成果
-
两阶段“全局-局部”策略搜索方法:
- 在智能建筑空调需求响应控制中,相比ES-RL和传统方法,表现出更高的恢复能力。
- 在不同误差等级下,策略性能稳定,具有较好的鲁棒性。
-
基于课程学习的策略搜索方法:
- 通过课程学习,策略在不同难度和不确定性下均表现优异。
- 实验结果显示,该方法在6种不同误差等级下的性能优于直接训练方法。
强化学习在电力系统中的应用
1. 强化学习的优势
- 快速决策:适合实时响应和复杂系统。
- 轻量部署:可适应不同规模的系统和平台。
- 适应复杂问题:在多代理和分布式环境中表现良好。
2. 强化学习的挑战
- 高维参数与复杂环境:训练过程困难,易陷入局部最优。
- 数据需求:需要大量数据支持学习,对数据质量要求高。
- 不确定性处理:需结合优化方法,提升策略的鲁棒性。
实验与结果分析
1. 两阶段“全局-局部”策略搜索方法实验结果
| 误差等级 | Proposed CL | Observed CL | ES-RL | Ape-CL |
|---|---|---|---|---|
| 0% | 23.36 | 1.31 | 18.07 | 13.45 |
| 5% | 23.68 | 1.39 | 18.38 | 14.01 |
| 10% | 23.14 | 1.40 | 18.01 | 12.66 |
| 15% | 23.63 | 1.40 | 17.52 | 10.18 |
| 20% | 22.61 | 1.30 | 17.63 | 5.70 |
| 25% | 22.71 | 1.39 | 16.86 | 13.30 |
2. 强化学习方法与传统方法对比
- 传统方法:在新能源发电误差增加时,控制性能下降明显。
- 强化学习方法:表现出更好的鲁棒性,尤其是在高不确定性场景中。
研究意义与应用前景
- 解决电力系统复杂问题:通过强化学习方法,能够有效应对强时序相关性和多重约束问题。
- 提升系统稳定性与效率:在电网恢复、需求响应等场景中,强化学习方法能够实现更快速、更可靠的控制。
- 推动智能化发展:为电力系统智能化提供新的思路和方法,结合模型与数据,实现高效策略训练与部署。
结论
张翔昱的研究展示了强化学习在电力系统优化控制中的潜力,特别是在处理强时序相关性和不确定性方面。通过两阶段“全局-局部”和基于课程学习的方法,有效提升了策略训练的效率和鲁棒性,为实际工程应用提供了有力支持。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载