什么是灾难恢复 (DR)?

一张商务人士在现代化办公室中其办公桌前使用计算机的图片

作者

Stephanie Susnjara

Staff Writer

IBM Think

Ian Smalley

Staff Editor

IBM Think

什么是灾难恢复 (DR)?

灾难恢复 (DR) 是一个由 IT 技术和最佳实践构成的框架,旨在防止或最小化灾难性事件导致的数据丢失和业务中断。

内容涵盖了设备故障、局部停电、犯罪或军事攻击、网络攻击和自然灾害等各种情况。

许多企业(尤其是中小型组织)忽视了制定可靠且实用的灾难恢复计划 (DRP)。若没有此类计划,它们几乎无法免受重大中断事件的影响。

计划外停机的代价使得数据丢失保护至关重要。 根据 Splunk 与 Oxford Economics 的研究,企业组织停机的平均成本可高达每分钟 9000 美元(或每小时 54 万美元)。对于处理敏感数据的高风险金融机构与医疗机构而言,停机可能导致每小时超过 500 万美元的损失。1灾难恢复规划能显著降低这些风险。

灾难恢复包括战略制定、规划、部署适当的科技以及实施持续测试。虽然数据备份很关键,但备份和恢复过程本身并不能构成全面的灾难恢复计划。

灾难恢复还涉及确保具备充足的存储与计算资源,以维持健全的故障转移与故障恢复流程。故障转移是将工作负载转移至备份系统的过程,旨在使生产流程与终端用户体验尽可能少受干扰。故障恢复则是切换回原始主系统的过程。

什么是业务连续性灾难恢复 (BCDR)?

业务连续性灾难恢复 (BCDR) 是在灾难发生时帮助组织恢复正常业务流程的方法。业务连续性与灾难恢复存在诸多共同点,但属于两种不同的应对方案。

尽管 BCDR 有时被称为企业应急管理,但它与联邦应急管理署 (FEMA) 等政府项目存在显著差异。这些政府项目侧重于民事应急事件,提供公共安全及社区范围的灾难援助,而非针对组织的 IT 系统与运营。

AI 学院

利用混合云实现 AI 就绪

本课程由 IBM 资深思想领袖带领,旨在帮助企业领导者获得所需的知识,以便划分可以推动增长的 AI 投资的优先级。

业务连续性规划与灾难恢复规划 

业务连续性规划 (BCP) 由多个系统和流程组成,旨在确保企业所有领域在发生危机或紧急情况下能够维持或迅速恢复基本运营。

灾难恢复规划是业务连续性规划的一个子集,专注于恢复 IT 基础设施和系统。它涉及一个灾难恢复计划 (DRP),该计划规划了从意外事件中恢复的步骤。企业依赖 DRP 来管理各种灾害情况(例如,自然灾害、 勒索软件恶意软件攻击)。

灾难恢复规划的 7 个关键步骤

以下七个步骤对有效的灾难恢复规划至关重要:

  1. 执行业务影响分析 (BIA)
  2. 分析风险
  3. 确定应用程序优先级
  4. 记录依赖关系
  5. 制定 RTO、RPO 和 RCO 目标
  6. 考虑法规合规性问题
  7. 实施持续测试和审查

1. 执行业务影响分析 (BIA)

制定全面的灾难恢复计划首先要进行业务影响分析 (BIA)。执行此分析时,您需要创建一系列详细的灾难场景。然后,可以利用这些情景来预测某些业务流程中断时所造成的损失规模和范围。例如,如果一场火灾摧毁了您的客户服务中心要怎么办?或者您的总部遭遇了地震又该怎么做?

此分析使您能够识别最关键的业务功能,并确定其中每个功能可以容忍多长的停机时间。掌握这些信息后,您可以开始制定在各种场景下维持最关键运营的计划。

IT 灾难恢复规划应基于并支持业务连续性规划。例如,如果您的业务连续性计划要求客户服务代表在客户服务中心发生火灾后在家工作,该怎么办?需要准备哪些类型的硬件、软件和 IT 资源来支持该计划?

2. 分析风险

评估企业所面临风险的可能性和潜在后果,是灾难恢复策略的关键组成部分。随着网络攻击和勒索软件变得越来越普遍,理解所有企业当前面临的普遍网络安全风险至关重要。此外,了解特定于您行业和地理位置的风险也很重要。

对于各种场景,包括自然灾害、设备故障、内部威胁、蓄意破坏和员工错误,评估您的风险并考虑其对业务的整体影响非常重要。

思考以下问题:

  • 您将因错失销售机会或收入生成活动中断而承受何种财务损失?
  • 您的品牌声誉会遭受哪些损害?客户满意度会受到什么影响?
  • 员工的工作效率会受到什么影响?可能会损失多少工时?
  • 该事件可能对人类健康或安全构成哪些风险?
  • 任何业务计划或目标的推进是否会受到影响?如何影响?

3. 确定应用程序优先级

并非所有工作负载对您企业维持运营的能力都同样关键,并且某些应用程序对停机时间的容忍度远高于其他应用程序。

根据您可以承受的系统停机时间以及数据丢失后果的严重程度,将您的 IT 系统和应用程序分为三个层级:

  1. 任务关键型:其功能对您企业的生存至关重要的应用程序。
  2. 重要提示:对于有些应用程序,您或许能够接受短时间的停机。
  3. 非必要:可以暂时用手动流程替代或无需使用的应用程序。

4. 记录依赖关系

灾难恢复规划的下一步,是清点所有硬件和软件资产并建立完整清单。在此阶段了解关键应用程序的相互依赖性至关重要。如果一个软件应用程序宕机,将会影响哪些其他应用程序?

在系统最初构建时就将数据弹性和灾难恢复模型设计到其中,是管理应用程序相互依赖性的最佳方法。在当今基于微服务的架构中,一种非常普遍的情况是:当某些系统或进程宕机时,依赖它们的其他进程也无法启动,反之亦然。

这种情况很难恢复。在实际灾难发生之前,趁您还有时间为系统和流程制定备用计划时发现此类问题也至关重要。

5. 制定 RTO、RPO 和 RCO 目标

通过考虑风险和业务影响分析,您可以设定多个目标,其中包括恢复系统所需的时间、可承受的数据丢失量以及可以接受的数据损坏或偏差量。

  • 恢复时间目标 (RTO) 是指在服务中断后恢复应用程序或系统功能所需的最长时间。
  • 恢复点目标 (RPO) 是指必须恢复的数据的最长存留时间,以便您的业务恢复正常运营。对于某些企业而言,即使丢失仅几分钟的数据也可能是灾难性的,而其他行业的企业或许能够容忍更长的时间窗口。
  • 恢复一致性目标 (RCO) 是数据保护服务中使用的一项指标。该指标指明了在灾难恢复情形下,从恢复的流程或系统中产生的业务数据里,有多少不一致条目是可容忍的。它描述了跨复杂应用程序环境的业务数据的完整性。

6. 考虑监管合规问题

您的企业已建立的所有灾难恢复软件与解决方案,都必须满足您被强制要求遵守的任何数据保护与安全要求。这意味着所有数据备份与故障转移系统必须按照与主系统同等的数据保密性与完整性标准进行设计。

同时,多项监管标准规定所有企业必须制定灾难恢复与业务连续性计划。例如,《萨班斯-奥克斯利法案》(SOX) 要求所有美国上市公司必须保留所有业务记录副本至少五年。

不遵守本规定(包括疏于建立和测试适当的数据备份系统)可能会导致公司面临巨额罚款,甚至其领导人可能面临牢狱之灾。

7. 实施持续测试和审查

简而言之,如果您的灾难恢复计划未经测试,则不能将其视为可靠。所有负有相关责任的员工都应参加灾难恢复测试演练,其中可能包括在指定时间内从故障转移站点维持运营。

如果执行全面灾难恢复测试超出您的预算或能力范围,您也可以安排以“桌面推演方式进行测试”的方式走查。但相比完整测试,此类测试发现灾难恢复流程中异常或弱点(尤其是先前未发现的应用程序依赖关系)的可能性较低。

由于硬件和软件资产会随时间推移而变化,应确保对灾难恢复计划进行相应更新。因此,定期审查并修订计划非常重要。

 请前往此处查看灾难恢复计划示例

灾难恢复的优势

灾难恢复能提供以下关键优势:

  • 业务连续性:帮助企业在意外事件发生后恢复正常运营。

  • 高可用性 (HA):通过在主系统故障时实现自动或快速故障转移至冗余系统,确保高可用性

  • 减少停机时间:快速恢复关键系统与应用程序,将业务中断降至最低。

  • 节约成本:减少因停机与数据丢失导致的财务损失。

  • 增强数据安全和合规性:使公司能够保护其数据并遵守隐私法律和行业法规。

  • 增强客户信任:即使在系统故障或灾难期间,也能确保服务一致性和客户数据安全,维护客户信任。

灾难恢复解决方案的类型

灾难恢复包括以下技术与解决方案类型:

  • 灾难恢复站点
  • 备份
  • 基于快照的复制
  • 云 DR
  • 灾难恢复即服务 (DRaaS)

灾难恢复站点

构建自有灾难恢复数据中心需要在多个相互冲突的目标之间取得平衡。

尽管如此,数据的副本还是应该存储在距离总部或办公地点足够远的地方。这样,影响主站点的相同地震事件、环境威胁或其他危险就不会永久性破坏数据。

同时,与主站点本地存储的备份相比,异地存储的备份恢复时间更长。此外,距离越远,网络延迟可能越高。

 

备份

备份与恢复是构建任何可靠灾难恢复计划的基础。

  • 磁带与早期磁盘:过去,大多数企业依赖磁带和机械硬盘(例如硬盘驱动器 (HDD)) 进行备份。他们保存数据的多个副本,并至少将一份存储在异地。
  • 现代磁盘备份:随着企业逐渐淘汰磁带,磁盘系统凭借更快的性能成为备份存储的标准。现代磁盘解决方案在本地存储、NASSAN 配置中使用硬盘驱动器或固态硬盘 (SSD)。与磁带系统相比,这一变革显著缩短了恢复时间。

基于快照的复制

数据库的快照备份可及时捕获应用程序或磁盘的当前状态。通过仅写入自上次快照以来更改的数据,该方法可以帮助保护数据,同时节省存储空间。

快照可被复制到其他位置或存储在云中,用于灾难恢复目的。

云灾难恢复 (云 DR)

云 DR 使用基于云的基础设施和服务来备份及恢复数据与应用程序,从而消除了维护物理次级数据中心的需求。

它使您能够保护应用程序数据及完整的服务器基础设施,包括使用公有云或专属服务提供商设置的物理或虚拟机 (VM)。您可以根据具体需求配置备份计划。

云备份解决方案还能与 VMware虚拟化平台或云原生备份解决方案集成。这些方法随着存储需求的变化提供灵活的可扩展性和成本优化,并支持正在进行云迁移 的组织。

灾难恢复即服务 (DRaaS)

灾难恢复即服务 (DRaaS) 是一种基于云的第三方解决方案,按需并按使用量付费的方式提供数据保护和 DR  能力。

DRaaS 是当今最受欢迎且增长最快的托管 IT 服务产品之一。一项 2023 年的行业研究预测,DRaaS 市场将从 107 亿美元增长至 2028 年的 265 亿美元,复合年增长率可观。2

借助 DRaaS,您的服务提供商会将 RTO 和 RPO 记录在服务级别协议 (SLA) 中,该协议中明确了您的停机时间限制和应用程序恢复预期。

DRaaS 产品通常还包括基于云的应用程序恢复操作。与在自己的数据中心维护冗余专用硬件资源相比,这种方法可显著节省成本。有些合约规定,您需要支付维护故障转移功能的费用,以及灾难恢复过程所消耗资源的每次使用费用。这样,供应商通常会承担配置和维护故障转移环境的所有责任。

DRaaS 与 DR

如果您已经构建了本地灾难恢复 (DR) 解决方案,评估维护该方案与转向按月订阅的 DRaaS 的成本和效益可能具有挑战性。

大多数本地部署灾难恢复 (DR) 解决方案会产生硬件、电力、维护和管理人工、软件和网络连接成本。除了在 DR 环境初期搭建时的前期资本支出外,还需要为定期软件升级预留预算。

由于您的 DR 解决方案必须与主生产环境保持兼容,您应确保 DR 解决方案具有相同的软件版本。根据您的许可协议具体条款,可能会使您的软件成本实际上翻倍。

如果您正在考虑第三方 DRaaS 解决方案,请确保供应商具备跨区域、多站点备份的能力。如果重大天气事件(例如飓风)影响您的主要办公地点,故障转移站点是否足够远离风暴影响范围?

如果您所在地区的多家供应商客户同时受到影响,您的供应商是否拥有足够容量来满足他们的综合需求?您需要信赖 DRaaS 供应商能在危机时刻满足 RTO 和 RPO 要求,因此应寻找具有卓越可靠性声誉的服务提供商。

若需获取这两种解决方案的更多对比视角,请查阅: 灾难恢复即服务 (DRaaS) 与灾难恢复 (DR):您需要哪种?

灾难恢复与 AI

人工智能 (AI) 集成正在推动灾难恢复变革,其功能包括增强威胁检测、自动事件响应以及简化混合多云环境管理。

根据 IBM  2025 年数据泄露成本报告,全球平均数据泄露成本从 488 万美元下降至 444 万美元,降幅达 9%。该报告指出,各组织能够发现并遏制数据泄露的中位时间缩短至 241 天,为 9 年来的最低值。

AI 在灾难恢复中提供以下主要优势:

  • 预测性分析:AI 模型通过分析历史数据,在潜在故障或安全漏洞发生前进行预测。此过程实现了预测性分析并支持风险缓解。
  • 实时监控:机器学习 (ML) 系统算法有助于实时监控基础设施运行状态。警报功能帮助团队检测异常并预防停机或数据丢失。
  • 自动响应:AI 驱动的自动化可实现比人工干预更快的恢复程序,从而显著降低 RTO 和 RPO。
  • 生成式 AI 辅助:大型语言模型 (LLM) 通过分析日志进行根本原因分析、自动生成事件文档以及提供对话式界面来支持快速恢复,从而改进灾难恢复工作流。此过程帮助团队将数据转化为可执行步骤。
相关解决方案
IBM Cloud Infrastructure Center

IBM® Cloud Infrastructure Center 是一个兼容 OpenStack 的软件平台,旨在管理基于 IBM® zSystems 和 IBM® LinuxONE 运行的私有云基础设施。

深入了解 Cloud Infrastructure Center
IT 基础架构

跨混合云环境构建安全的 AI 就绪型基础设施

深入了解 IT 基础设施解决方案
基础设施服务

在 IBM® Technology Expert Labs 专家的指导下,加速、保护并优化您的混合云和企业基础设施。

深入了解基础设施服务
采取后续步骤

利用 IBM 的混合云和 AI 就绪解决方案来实现企业基础设施转型。深入了解旨在保护、扩展和实现企业的现代化改造的服务器、存储和软件,或获取专家洞察分析,从而强化您的生成式 AI 战略。

  1. 深入了解 IT 基础设施解决方案
  2. 深入了解 IBM Cloud
脚注

1. 停机隐形成本——根据全球 2000 强高管的观点,Splunk,2024 年 6 月

2.  灾难恢复即服务 (DRaaS) 市场规模,MarketsandMarkets,2023 年