【亚马逊云科技】2024年Amazon_Aurora_数据库高可用及容灾白皮书_32页_3mb
报告摘要
Amazon Aurora高可用与容灾白皮书总结
Amazon Aurora是一款全托管的关系型数据库服务,兼容MySQL和PostgreSQL,提供高可用性(HA)和容灾(DR)能力。其核心特性包括分布式存储、多可用区部署、跨区域Global Database功能及自动化管理机制,可满足全球化应用程序对业务连续性的需求。
高可用性与容灾能力
-
单区域高可用性
- 采用多可用区(Multi-AZ)架构,由一个写入实例和多个只读实例组成。写入实例故障时,Aurora自动切换至指定的只读实例,确保服务连续性。
- 支持99.99%(4个9)的SLA,通过集群端点实现无缝连接,无需应用修改即可完成故障转移。故障转移最长需60秒,应用需重新提交中断期间的请求。
- 使用Amazon RDS Proxy可进一步缩短故障转移时间,减少连接中断风险。
-
跨区域容灾(Global Database)
- 支持跨多个区域部署,最多配置5个备区域,每个区域最多15个只读实例。
- 通过异步复制实现低延迟本地读取(通常<1秒),主区域故障时可快速切换至备区域,RTO可达1分钟,RPO可设定为1秒。
- 提供两种切换方式:GlobalDatabaseSwitchover(主备切换,需手动操作)和GlobalDatabaseFailover(自动故障转移,适用于区域级故障)。
- Headless集群模式:备区域仅包含存储卷无数据库实例,降低资源成本,但需满足RTO需求(如切换时间在10分钟以内)。
关键管理工具与功能
- 备份与恢复:支持自动备份(保留周期1-35天)和手动快照,结合时间点恢复(PITR)可将数据库还原至任意时间点。
- 监控:通过Amazon CloudWatch Logs、增强监控及RDS Performance Insights追踪数据库状态、性能及复制延迟。关键指标包括Aurora Replica Lag、Aurora Global DB RPOLag(监控备集群数据同步延迟)。
- 容灾策略设计
- 明确RTO(恢复时间目标)和RPO(恢复点目标),针对不同业务场景设定差异化的恢复要求。
- 使用Managed RPO功能(仅PostgreSQL支持),通过rdsglobal_db_rpo参数控制主集群事务提交条件,确保备集群数据同步在指定范围内。
最佳实践
- 制定恢复目标:结合业务需求定义RTO和RPO,并将高可用性与容灾策略与之匹配。
- 文档与测试:编写详细的高可用和容灾流程文档,包括备份规则、故障转移步骤及恢复验证。定期执行容灾演练,验证策略有效性。
- 跨区域部署优化:利用Global Database实现读写分离,通过写入转发功能将写操作定向至就近备区域,降低延迟并提升韧性。
- 维护与升级:采用蓝/绿部署减少计划内停机时间,零停机打补丁(ZDP)功能在小版本升级期间保持客户端连接。
典型使用场景
- 区域故障恢复:通过GlobalDatabaseFailover自动切换至数据同步延迟最小的备区域,最大限度减少数据丢失。
- 合规性测试:使用GlobalDatabaseSwitchover定期轮换主备区域,确保容灾流程可控且无数据丢失。
- 成本控制:Headless集群模式可节省计算资源费用,但需权衡RTO要求与备份时效性。
- 维护期间可用性:蓝绿部署允许在复制后无缝切换生产环境,避免写入中断。
注意事项
- Aurora的高可用性依赖其分布式存储和多副本机制,但需结合业务需求选择部署模式。
- 跨区域容灾需关注数据同步延迟(RPO)和恢复时间(RTO),并配置监控以及时预警潜在问题。
- 容灾策略需定期测试和审查,确保与实际业务变化和基础设施升级保持同步。
该白皮书强调通过Aurora的自动化能力和灵活架构设计,用户可在不同层级(单区域、跨区域)实现高效、经济的业务连续性方案。建议结合Amazon Well-Architected Framework评估架构合理性,并利用托管工具简化操作流程。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载