DR
Disaster Recovery
灾难恢复 · 系统崩溃后的「复活甲」
- 定义
- DR(Disaster Recovery)是DevOps领域的专业术语。DR 是指组织在遭遇宕机、网络攻击、自然灾害等突发事件后,恢复关键 IT 系统和数据的策略与流程。
最后更新:2026-04-08
什么是DR?
DR 是指组织在遭遇宕机、网络攻击、自然灾害等突发事件后,恢复关键 IT 系统和数据的策略与流程。2025 年全球 DRaaS(灾难恢复即服务)市场规模约 161 亿美元,预计 2032 年达 461 亿美元——勒索软件攻击的激增让 DR 从「保险」变成了刚需。
- 核心指标是 RTO(恢复时间目标)和 RPO(恢复点目标),决定了能容忍多久宕机和丢多少数据
- 云时代 DR 从自建备份机房转向 DRaaS,成本大幅下降
- 勒索软件是当前 DR 规划的头号驱动力——没有可靠备份等于给攻击者交赎金
DR详解
灾难恢复涵盖从数据备份、系统复制到故障切换(Failover)的完整技术栈。传统 DR 依赖异地备份机房,成本高且测试困难;云原生时代,DRaaS 通过跨区域数据复制和自动化故障切换,将 RTO 从小时级压缩到分钟级。DR 方案通常分为四个层级:备份恢复(成本最低、恢复最慢)、Pilot Light(核心组件常驻)、Warm Standby(缩小版生产环境待命)和 Multi-Site Active-Active(多活架构、近零中断)。2025 年的趋势包括:AI 基础设施的 DR 挑战(70B 模型检查点达 150-200GB)、多云多区域架构成为默认选项、以及勒索软件驱动的不可变备份(Immutable Backup)需求激增。
公式提示
RTO = 能容忍的最长宕机时间;RPO = 能容忍的最大数据丢失量;RTO 和 RPO 越小,DR 方案越贵。
DR的应用场景
正式定义
组织在遭遇破坏性事件后恢复关键 IT 基础设施、数据和业务功能的策略、流程与技术方案的总称。
应用场景
- 制定业务连续性计划(BCP)中的技术恢复方案
- 应对勒索软件攻击后的数据和系统恢复
- 云架构中的跨区域故障切换设计
- 满足金融、医疗等行业的合规审计要求
常见误区
- DR 不等于备份——备份只是 DR 的一部分,DR 还包括切换策略、演练流程和恢复验证
- 有了云不代表自动有 DR——云上资源同样需要显式设计跨区域复制和故障切换
- DR 演练不是走过场——未经真实模拟验证的 DR 方案在灾难发生时大概率失败
实际案例
📌 勒索软件攻击后的 DR 响应
某企业遭勒索软件加密全部生产数据库,因提前部署了跨区域不可变备份,在 2 小时内从备份恢复业务,避免了支付赎金和数周的停机损失。
📌 多区域 Active-Active 架构
一家 SaaS 公司在 AWS 两个区域部署 Active-Active 架构,通过 Route 53 健康检查自动切换流量。当主区域发生故障时,用户请求在 30 秒内自动路由到备用区域,实现近零中断。
DR的参考来源
关于DR的常见问题
- DR 和备份有什么区别
- 备份是把数据复制一份存起来,DR 是一整套恢复方案——包括备份、故障切换、流量调度、恢复验证和演练流程。备份是 DR 的基础,但光有备份不等于有 DR 能力。
- RTO 和 RPO 是什么意思
- RTO(恢复时间目标)是系统宕机后能容忍的最长恢复时间,RPO(恢复点目标)是能容忍丢失的最大数据量。比如 RTO=1 小时、RPO=15 分钟,意味着必须在 1 小时内恢复,且最多丢 15 分钟的数据。
- 小公司需要 DR 吗
- 需要。云时代 DRaaS 大幅降低了 DR 门槛,按需付费的跨区域备份和自动切换方案已经很成熟。尤其在勒索软件泛滥的当下,没有 DR 方案的小公司一旦中招可能直接倒闭。