【亚马逊云科技】2024年Amazon_Aurora数据库高可用与容灾白皮书_32页_3mb
报告摘要
Amazon Aurora是亚马逊云科技提供的全托管关系型数据库服务,兼容MySQL和PostgreSQL,具备高可用性和容灾能力。其高可用性(HA)和容灾(DR)功能涵盖单区域和跨区域部署模式,旨在保障业务连续性。本文档总结如下:
-
架构特性
Aurora采用分布式存储架构,数据在三个可用区(AZ)内复制,支持六副本机制。即使发生整个可用区故障,数据仍可保持完整。计算与存储解耦设计使系统具备自我修复能力,且通过多可用区部署实现自动故障转移。跨区域方案借助GlobalDatabase功能,支持异步复制(延迟<1秒),允许在多个区域扩展读取能力。 -
单区域高可用与容灾
单区域部署需配置多可用区集群:一个写入实例和至少一个只读实例。写入实例故障时,Aurora自动将可用只读实例提升为主实例,应用程序可通过集群端点无缝切换,无须修改连接逻辑。默认提供99.99%的SLA保障,故障转移时间最长60秒。使用Amazon RDS Proxy可缩短故障转移时间至33%以内。 -
跨区域容灾方案
GlobalDatabase支持最多部署至5个备区域,每个区域可配置15个只读实例。通过入站复制(数据写入备区域)和出站复制(数据从主区域同步至备区域),实现跨区域故障恢复。主区域故障时,GlobalDatabaseFailover功能可将备区域快速切换为新主区域,恢复时间目标(RTO)可达1分钟,恢复点目标(RPO)低至1秒。此外,Headless集群模式允许备区域仅含存储卷,降低资源成本。 -
监控与事件管理
Aurora提供CloudWatch Logs、增强监控和Performance Insights等工具,用于跟踪数据库状态及性能指标。关键指标包括AuroraReplicaLag(复制延迟)、AuroraGlobalDBRPOLag(RPO延迟)、CPU利用率等。事件通知功能可实时将数据库变更(如备份、故障转移)同步至CloudWatchEvents和EventBridge,便于监控与响应。 -
容灾策略设计
企业需根据业务需求明确RTO(恢复时间目标)和RPO(恢复点目标)。例如,关键业务系统需严格设定RTO和RPO,而低优先级工作负载可放宽要求。AuroraPostgreSQLGlobalDatabase支持ManagedRPO参数,通过监控备集群延迟确保事务提交符合RPO约束。备份保留时间可配置为1-35天,结合手动快照和AmazonBackup服务实现更灵活的容灾管理。 -
最佳实践
- 编写并测试容灾流程文档,涵盖备份策略、故障转移配置、脚本位置等关键细节。
- 定期执行容灾演练,验证流程有效性并优化。
- 利用蓝绿部署减少维护期间停机时间,如版本升级或Schema变更时,通过预生产环境无缝切换生产流量。
- 针对网络波动或延迟问题,采用写入转发功能将写请求定向至备区域的只读实例,降低全局延迟。
-
使用场景
- 多区域读写支持:通过GlobalDatabase将写请求转发至就近备区域,提升性能并减少数据延迟。
- 成本优化:Headless集群模式下备区域仅存储数据,无需数据库实例,节省资源费用。
- 合规性测试:使用GlobalDatabaseSwitchover功能定期轮换主备区域,确保容灾流程有效性。
- 快速故障恢复:在区域级故障时,通过Failover机制自动切换主备集群,确保零数据丢失(RPO=0)。
-
注意事项
- 容灾策略需与业务需求匹配,严格RPO要求时可结合ManagedRPO参数控制数据一致性。
- 手动快照需人工管理,且旧主区域恢复后需重新整合至拓扑结构。
- 蓝绿部署切换期间可能产生短暂停机,需根据实际负载评估影响。
总结:Amazon Aurora通过多可用区部署和GlobalDatabase跨区域扩展,结合自动故障转移、复制机制及监控工具,为企业提供高可用性和容灾能力。合理规划RTO/RPO、制定流程文档并定期测试是保障业务连续性的关键。该架构适用于需要全球数据一致性和快速恢复的分布式应用,同时支持灵活的成本控制方案。
试读结束,高清完整版pdf/doc/ppt,请点下载