灾难恢复 (DR) 是一个由 IT 技术和最佳实践构成的框架,旨在防止或最小化灾难性事件导致的数据丢失和业务中断。
内容涵盖了设备故障、局部停电、犯罪或军事攻击、网络攻击和自然灾害等各种情况。
许多企业(尤其是中小型组织)忽视了制定可靠且实用的灾难恢复计划 (DRP)。若没有此类计划,它们几乎无法免受重大中断事件的影响。
计划外停机的代价使得数据丢失保护至关重要。 根据 Splunk 与 Oxford Economics 的研究,企业组织停机的平均成本可高达每分钟 9000 美元(或每小时 54 万美元)。对于处理敏感数据的高风险金融机构与医疗机构而言,停机可能导致每小时超过 500 万美元的损失。1灾难恢复规划能显著降低这些风险。
灾难恢复包括战略制定、规划、部署适当的科技以及实施持续测试。虽然数据备份很关键,但备份和恢复过程本身并不能构成全面的灾难恢复计划。
灾难恢复还涉及确保具备充足的存储与计算资源,以维持健全的故障转移与故障恢复流程。故障转移是将工作负载转移至备份系统的过程,旨在使生产流程与终端用户体验尽可能少受干扰。故障恢复则是切换回原始主系统的过程。
通过 Think 时事通讯,了解有关 AI、自动化、数据等方面最重要且最有趣的行业趋势。请参阅 IBM 隐私声明。
业务连续性灾难恢复 (BCDR) 是在灾难发生时帮助组织恢复正常业务流程的方法。业务连续性与灾难恢复存在诸多共同点,但属于两种不同的应对方案。
尽管 BCDR 有时被称为企业应急管理,但它与联邦应急管理署 (FEMA) 等政府项目存在显著差异。这些政府项目侧重于民事应急事件,提供公共安全及社区范围的灾难援助,而非针对组织的 IT 系统与运营。
业务连续性规划 (BCP) 由多个系统和流程组成,旨在确保企业所有领域在发生危机或紧急情况下能够维持或迅速恢复基本运营。
灾难恢复规划是业务连续性规划的一个子集,专注于恢复 IT 基础设施和系统。它涉及一个灾难恢复计划 (DRP),该计划规划了从意外事件中恢复的步骤。企业依赖 DRP 来管理各种灾害情况(例如,自然灾害、 勒索软件、恶意软件攻击)。
以下七个步骤对有效的灾难恢复规划至关重要:
制定全面的灾难恢复计划首先要进行业务影响分析 (BIA)。执行此分析时,您需要创建一系列详细的灾难场景。然后,可以利用这些情景来预测某些业务流程中断时所造成的损失规模和范围。例如,如果一场火灾摧毁了您的客户服务中心要怎么办?或者您的总部遭遇了地震又该怎么做?
此分析使您能够识别最关键的业务功能,并确定其中每个功能可以容忍多长的停机时间。掌握这些信息后,您可以开始制定在各种场景下维持最关键运营的计划。
IT 灾难恢复规划应基于并支持业务连续性规划。例如,如果您的业务连续性计划要求客户服务代表在客户服务中心发生火灾后在家工作,该怎么办?需要准备哪些类型的硬件、软件和 IT 资源来支持该计划?
并非所有工作负载对您企业维持运营的能力都同样关键,并且某些应用程序对停机时间的容忍度远高于其他应用程序。
根据您可以承受的系统停机时间以及数据丢失后果的严重程度,将您的 IT 系统和应用程序分为三个层级:
通过考虑风险和业务影响分析,您可以设定多个目标,其中包括恢复系统所需的时间、可承受的数据丢失量以及可以接受的数据损坏或偏差量。
您的企业已建立的所有灾难恢复软件与解决方案,都必须满足您被强制要求遵守的任何数据保护与安全要求。这意味着所有数据备份与故障转移系统必须按照与主系统同等的数据保密性与完整性标准进行设计。
同时,多项监管标准规定所有企业必须制定灾难恢复与业务连续性计划。例如,《萨班斯-奥克斯利法案》(SOX) 要求所有美国上市公司必须保留所有业务记录副本至少五年。
不遵守本规定(包括疏于建立和测试适当的数据备份系统)可能会导致公司面临巨额罚款,甚至其领导人可能面临牢狱之灾。
简而言之,如果您的灾难恢复计划未经测试,则不能将其视为可靠。所有负有相关责任的员工都应参加灾难恢复测试演练,其中可能包括在指定时间内从故障转移站点维持运营。
如果执行全面灾难恢复测试超出您的预算或能力范围,您也可以安排以“桌面推演方式进行测试”的方式走查。但相比完整测试,此类测试发现灾难恢复流程中异常或弱点(尤其是先前未发现的应用程序依赖关系)的可能性较低。
由于硬件和软件资产会随时间推移而变化,应确保对灾难恢复计划进行相应更新。因此,定期审查并修订计划非常重要。
请前往此处查看灾难恢复计划示例。
灾难恢复能提供以下关键优势:
灾难恢复包括以下技术与解决方案类型:
构建自有灾难恢复数据中心需要在多个相互冲突的目标之间取得平衡。
尽管如此,数据的副本还是应该存储在距离总部或办公地点足够远的地方。这样,影响主站点的相同地震事件、环境威胁或其他危险就不会永久性破坏数据。
同时,与主站点本地存储的备份相比,异地存储的备份恢复时间更长。此外,距离越远,网络延迟可能越高。
备份与恢复是构建任何可靠灾难恢复计划的基础。
数据库的快照备份可及时捕获应用程序或磁盘的当前状态。通过仅写入自上次快照以来更改的数据,该方法可以帮助保护数据,同时节省存储空间。
快照可被复制到其他位置或存储在云中,用于灾难恢复目的。
灾难恢复即服务 (DRaaS) 是一种基于云的第三方解决方案,按需并按使用量付费的方式提供数据保护和 DR 能力。
DRaaS 是当今最受欢迎且增长最快的托管 IT 服务产品之一。一项 2023 年的行业研究预测,DRaaS 市场将从 107 亿美元增长至 2028 年的 265 亿美元,复合年增长率可观。2
借助 DRaaS,您的服务提供商会将 RTO 和 RPO 记录在服务级别协议 (SLA) 中,该协议中明确了您的停机时间限制和应用程序恢复预期。
DRaaS 产品通常还包括基于云的应用程序恢复操作。与在自己的数据中心维护冗余专用硬件资源相比,这种方法可显著节省成本。有些合约规定,您需要支付维护故障转移功能的费用,以及灾难恢复过程所消耗资源的每次使用费用。这样,供应商通常会承担配置和维护故障转移环境的所有责任。
如果您已经构建了本地灾难恢复 (DR) 解决方案,评估维护该方案与转向按月订阅的 DRaaS 的成本和效益可能具有挑战性。
大多数本地部署灾难恢复 (DR) 解决方案会产生硬件、电力、维护和管理人工、软件和网络连接成本。除了在 DR 环境初期搭建时的前期资本支出外,还需要为定期软件升级预留预算。
由于您的 DR 解决方案必须与主生产环境保持兼容,您应确保 DR 解决方案具有相同的软件版本。根据您的许可协议具体条款,可能会使您的软件成本实际上翻倍。
如果您正在考虑第三方 DRaaS 解决方案,请确保供应商具备跨区域、多站点备份的能力。如果重大天气事件(例如飓风)影响您的主要办公地点,故障转移站点是否足够远离风暴影响范围?
如果您所在地区的多家供应商客户同时受到影响,您的供应商是否拥有足够容量来满足他们的综合需求?您需要信赖 DRaaS 供应商能在危机时刻满足 RTO 和 RPO 要求,因此应寻找具有卓越可靠性声誉的服务提供商。
若需获取这两种解决方案的更多对比视角,请查阅: 灾难恢复即服务 (DRaaS) 与灾难恢复 (DR):您需要哪种?
人工智能 (AI) 集成正在推动灾难恢复变革,其功能包括增强威胁检测、自动事件响应以及简化混合和多云环境管理。
根据 IBM 2025 年数据泄露成本报告,全球平均数据泄露成本从 488 万美元下降至 444 万美元,降幅达 9%。该报告指出,各组织能够发现并遏制数据泄露的中位时间缩短至 241 天,为 9 年来的最低值。
AI 在灾难恢复中提供以下主要优势:
IBM® Cloud Infrastructure Center 是一个兼容 OpenStack 的软件平台,旨在管理基于 IBM® zSystems 和 IBM® LinuxONE 运行的私有云基础设施。
跨混合云环境构建安全的 AI 就绪型基础设施
在 IBM® Technology Expert Labs 专家的指导下,加速、保护并优化您的混合云和企业基础设施。
1. 停机隐形成本——根据全球 2000 强高管的观点,Splunk,2024 年 6 月
2. 灾难恢复即服务 (DRaaS) 市场规模,MarketsandMarkets,2023 年