什么是灾难恢复 (DR)?
发布时间:2026-08-07 | 浏览:10
灾难恢复 (DR) 是一个由 IT 技术和最佳实践构成的框架,旨在防止或最小化灾难性事件导致的数据丢失和业务中断。
内容涵盖了设备故障、局部停电、犯罪或军事攻击、 网络攻击 和自然灾害等各种情况。
许多企业(尤其是中小型组织)忽视了制定可靠且实用的 灾难恢复计划 (DRP) 。若没有此类计划,它们几乎无法免受重大中断事件的影响。
计划外停机的代价使得 数据丢失保护 至关重要。 根据 Splunk 与 Oxford Economics 的研究,企业组织停机的平均成本可高达每分钟 9000 美元(或每小时 54 万美元)。对于处理敏感数据的高风险金融机构与医疗机构而言,停机可能导致每小时超过 500 万美元的损失。 1 灾难恢复规划能显著降低这些风险。
灾难恢复包括战略制定、规划、部署适当的科技以及实施 持续测试 。虽然数据备份很关键,但备份和恢复过程本身并不能构成全面的灾难恢复计划。
灾难恢复还涉及确保具备充足的存储与计算资源,以维持健全的故障转移与故障恢复流程。 故障转移 是将 工作负载 转移至备份系统的过程,旨在使生产流程与终端用户体验尽可能少受干扰。 故障恢复 则是切换回原始主系统的过程。
辅以专家洞察分析的最新科技新闻
通过 Think 时事通讯,了解有关 AI、自动化、数据等方面最重要且最有趣的行业趋势。请参阅 IBM 隐私声明 。
什么是业务连续性灾难恢复 (BCDR)?
业务连续性灾难恢复 (BCDR) 是在灾难发生时帮助组织恢复正常业务流程的方法。 业务连续性 与灾难恢复存在诸多共同点,但属于两种不同的应对方案。
尽管 BCDR 有时被称为企业应急管理,但它与联邦应急管理署 (FEMA) 等政府项目存在显著差异。这些政府项目侧重于民事应急事件,提供公共安全及社区范围的灾难援助,而非针对组织的 IT 系统与运营。
加入我们世界级的专家小组——工程师、研究人员、产品负责人等将为您甄别 AI 领域的真知灼见,带来最新的 AI 资讯与深度解析。
业务连续性规划 (BCP) 由多个系统和流程组成,旨在确保企业所有领域在发生危机或紧急情况下能够维持或迅速恢复基本运营。
灾难恢复规划是业务连续性规划的一个子集,专注于恢复 IT 基础设施 和系统。它涉及一个 灾难恢复计划 (DRP) ,该计划规划了从意外事件中恢复的步骤。企业依赖 DRP 来管理各种灾害情况(例如,自然灾害、 勒索软件 、 恶意软件 攻击)。
灾难恢复规划的 7 个关键步骤
以下七个步骤对有效的灾难恢复规划至关重要:
制定 RTO、RPO 和 RCO 目标
1. 执行业务影响分析 (BIA)
制定全面的灾难恢复计划首先要进行业务影响分析 (BIA)。执行此分析时,您需要创建一系列详细的灾难场景。然后,可以利用这些情景来预测某些业务流程中断时所造成的损失规模和范围。例如,如果一场火灾摧毁了您的客户服务中心要怎么办?或者您的总部遭遇了地震又该怎么做?
此分析使您能够识别最关键的业务功能,并确定其中每个功能可以容忍多长的停机时间。掌握这些信息后,您可以开始制定在各种场景下维持最关键运营的计划。
IT 灾难恢复规划应基于并支持业务连续性规划。例如,如果您的业务连续性计划要求客户服务代表在客户服务中心发生火灾后在家工作,该怎么办?需要准备哪些类型的硬件、软件和 IT 资源来支持该计划?
评估企业所面临风险的可能性和潜在后果,是 灾难恢复策略 的关键组成部分。随着网络攻击和勒索软件变得越来越普遍,理解所有企业当前面临的普遍 网络安全 风险至关重要。此外,了解特定于您行业和地理位置的风险也很重要。
对于各种场景,包括自然灾害、设备故障、内部威胁、蓄意破坏和员工错误,评估您的风险并考虑其对业务的整体影响非常重要。
您将因错失销售机会或收入生成活动中断而承受何种财务损失?
您的品牌声誉会遭受哪些损害?客户满意度会受到什么影响?
员工的工作效率会受到什么影响?可能会损失多少工时?
该事件可能对人类健康或安全构成哪些风险?
任何业务计划或目标的推进是否会受到影响?如何影响?
并非所有工作负载对您企业维持运营的能力都同样关键,并且某些应用程序对停机时间的容忍度远高于其他应用程序。
根据您可以承受的系统停机时间以及数据丢失后果的严重程度,将您的 IT 系统和应用程序分为三个层级:
任务关键型: 其功能对您企业的生存至关重要的应用程序。
重要提示: 对于有些应用程序,您或许能够接受短时间的停机。
非必要: 可以暂时用手动流程替代或无需使用的应用程序。
灾难恢复规划的下一步,是清点所有硬件和软件资产并建立完整清单。在此阶段了解关键应用程序的相互依赖性至关重要。如果一个软件应用程序宕机,将会影响哪些其他应用程序?
在系统最初构建时就将 数据弹性 和灾难恢复模型设计到其中,是管理应用程序相互依赖性的最佳方法。在当今基于 微服务 的架构中,一种非常普遍的情况是:当某些系统或进程宕机时,依赖它们的其他进程也无法启动,反之亦然。
这种情况很难恢复。在实际灾难发生之前,趁您还有时间为系统和流程制定备用计划时发现此类问题也至关重要。
5. 制定 RTO、RPO 和 RCO 目标
通过考虑风险和业务影响分析,您可以设定多个目标,其中包括恢复系统所需的时间、可承受的数据丢失量以及可以接受的数据损坏或偏差量。
恢复时间目标 (RTO) 是指在服务中断后恢复应用程序或系统功能所需的最长时间。
恢复点目标 (RPO) 是指必须恢复的数据的最长存留时间,以便您的业务恢复正常运营。对于某些企业而言,即使丢失仅几分钟的数据也可能是灾难性的,而其他行业的企业或许能够容忍更长的时间窗口。
恢复一致性目标 (RCO) 是 数据保护 服务中使用的一项指标。该指标指明了在灾难恢复情形下,从恢复的流程或系统中产生的业务数据里,有多少不一致条目是可容忍的。它描述了跨复杂应用程序环境的业务数据的完整性。
您的企业已建立的所有灾难恢复软件与解决方案,都必须满足您被强制要求遵守的任何数据保护与安全要求。这意味着所有数据备份与故障转移系统必须按照与主系统同等的数据保密性与完整性标准进行设计。
同时,多项监管标准规定所有企业必须制定灾难恢复与业务连续性计划。例如, 《萨班斯-奥克斯利法案》(SOX) 要求所有美国上市公司必须保留所有业务记录副本至少五年。
不遵守本规定(包括疏于建立和测试适当的数据备份系统)可能会导致公司面临巨额罚款,甚至其领导人可能面临牢狱之灾。
简而言之,如果您的灾难恢复计划未经测试,则不能将其视为可靠。所有负有相关责任的员工都应参加灾难恢复测试演练,其中可能包括在指定时间内从故障转移站点维持运营。
如果执行全面灾难恢复测试超出您的预算或能力范围,您也可以安排以“桌面推演方式进行测试”的方式走查。但相比完整测试,此类测试发现灾难恢复流程中异常或弱点(尤其是先前未发现的应用程序依赖关系)的可能性较低。
由于硬件和软件资产会随时间推移而变化,应确保对灾难恢复计划进行相应更新。因此,定期审查并修订计划非常重要。
请前往此处查看 灾难恢复计划示例 。
业务连续性: 帮助企业在意外事件发生后恢复正常运营。
高可用性 (HA): 通过在主系统故障时实现自动或快速故障转移至冗余系统,确保 高可用性 。
减少停机时间: 快速恢复关键系统与应用程序,将业务中断降至最低。
节约成本: 减少因停机与数据丢失导致的财务损失。
增强数据安全和合规性: 使公司能够保护其数据并遵守隐私法律和行业法规。
增强客户信任: 即使在系统故障或灾难期间,也能确保服务一致性和客户数据安全,维护客户信任。
灾难恢复包括以下技术与解决方案类型:
灾难恢复即服务 (DRaaS)
构建自有灾难恢复 数据中心 需要在多个相互冲突的目标之间取得平衡。
尽管如此,数据的副本还是应该存储在距离总部或办公地点足够远的地方。这样,影响主站点的相同地震事件、环境威胁或其他危险就不会永久性破坏数据。
同时,与主站点本地存储的备份相比,异地存储的备份恢复时间更长。此外,距离越远,网络延迟可能越高。
备份与恢复 是构建任何可靠灾难恢复计划的基础。
磁带与早期磁盘: 过去,大多数企业依赖磁带和机械硬盘(例如 硬盘驱动器 (HDD) ) 进行备份。他们保存数据的多个副本,并至少将一份存储在异地。
现代磁盘备份: 随着企业逐渐淘汰磁带,磁盘系统凭借更快的性能成为备份存储的标准。现代磁盘解决方案在本地存储、 NAS 或 SAN 配置中使用硬盘驱动器或 固态硬盘 (SSD) 。与磁带系统相比,这一变革显著缩短了恢复时间。
数据库的快照备份可及时捕获应用程序或磁盘的当前状态。通过仅写入自上次快照以来更改的数据,该方法可以帮助保护数据,同时节省存储空间。
快照可被复制到其他位置或存储在云中,用于灾难恢复目的。
云 DR 使用基于云的基础设施和服务来备份及恢复数据与应用程序,从而消除了维护物理次级数据中心的需求。
它使您能够保护应用程序数据及完整的服务器基础设施,包括使用 公有云 或专属服务提供商设置的物理或 虚拟机 (VM) 。您可以根据具体需求配置备份计划。
云备份解决方案还能与 VMware 等 虚拟化 平台或 云原生 备份解决方案集成。这些方法随着存储需求的变化提供灵活的可扩展性和成本优化,并支持正在进行 云迁移 的组织。
灾难恢复即服务 (DRaaS)
灾难恢复即服务 (DRaaS) 是一种基于云的第三方解决方案,按需并按使用量付费的方式提供数据保护和 DR 能力。
DRaaS 是当今最受欢迎且增长最快的托管 IT 服务产品之一。一项 2023 年的行业研究预测,DRaaS 市场将从 107 亿美元增长至 2028 年的 265 亿美元,复合年增长率可观。 2
借助 DRaaS,您的服务提供商会将 RTO 和 RPO 记录在 服务级别协议 (SLA) 中,该协议中明确了您的停机时间限制和应用程序恢复预期。
DRaaS 产品通常还包括基于云的应用程序恢复操作。与在自己的数据中心维护冗余专用硬件资源相比,这种方法可显著节省成本。有些合约规定,您需要支付维护故障转移功能的费用,以及灾难恢复过程所消耗资源的每次使用费用。这样,供应商通常会承担配置和维护故障转移环境的所有责任。
如果您已经构建了本地灾难恢复 (DR) 解决方案,评估维护该方案与转向按月订阅的 DRaaS 的成本和效益可能具有挑战性。
大多数本地部署灾难恢复 (DR) 解决方案会产生硬件、电力、维护和管理人工、软件和 网络 连接成本。除了在 DR 环境初期搭建时的前期资本支出外,还需要为定期软件升级预留预算。
由于您的 DR 解决方案必须与主生产环境保持兼容,您应确保 DR 解决方案具有相同的软件版本。根据您的许可协议具体条款,可能会使您的软件成本实际上翻倍。
如果您正在考虑第三方 DRaaS 解决方案,请确保供应商具备跨区域、多站点备份的能力。如果重大天气事件(例如飓风)影响您的主要办公地点,故障转移站点是否足够远离风暴影响范围?
如果您所在地区的多家供应商客户同时受到影响,您的供应商是否拥有足够容量来满足他们的综合需求?您需要信赖 DRaaS 供应商能在危机时刻满足 RTO 和 RPO 要求,因此应寻找具有卓越可靠性声誉的服务提供商。
若需获取这两种解决方案的更多对比视角,请查阅: 灾难恢复即服务 (DRaaS) 与灾难恢复 (DR):您需要哪种?
人工智能 (AI) 集成正在推动灾难恢复变革,其功能包括增强威胁检测、自动事件响应以及简化 混合 和 多云 环境管理。
根据 IBM 2025 年数据泄露成本报告 ,全球平均数据泄露成本从 488 万美元下降至 444 万美元,降幅达 9%。该报告指出,各组织能够发现并遏制数据泄露的中位时间缩短至 241 天,为 9 年来的最低值。
AI 在灾难恢复中提供以下主要优势:
预测性分析: AI 模型通过分析历史数据,在潜在故障或安全漏洞发生前进行预测。此过程实现了 预测性分析 并支持风险缓解。
实时监控: 机器学习 (ML) 系统算法有助于实时监控基础设施运行状态。警报功能帮助团队检测异常并预防停机或数据丢失。
自动响应: AI 驱动的 自动化 可实现比人工干预更快的恢复程序,从而显著降低 RTO 和 RPO。
生成式 AI 辅助: 大型语言模型 (LLM) 通过分析日志进行根本原因分析、自动生成事件文档以及提供对话式界面来支持快速恢复,从而改进灾难恢复 工作流 。此过程帮助团队将数据转化为可执行步骤。
在始终在线的数字环境中,灾难恢复是确保业务连续性的关键能力。随着网络攻击、系统故障和基础设施宕机变得更加频繁且损失更大,组织面临的停机、数据丢失和运营中断风险日益增加。现代灾难恢复策略通过更自动化和更具弹性的方法,帮助基础设施负责人减少停机时间、加快恢复速度并快速恢复关键服务。
了解 APIS IT 如何使用 IBM Storage Defender 将虚拟机的备份性能提高 50%,将 Exchange 数据库的备份性能提高 62%,同时提升网络恢复就绪度。
网络弹性评估通过 IBM 安全专家和存储空间架构师共同举行的 2 小时免费虚拟研讨会进行。
了解 HEFAME 如何利用 IBM Power Virtual Server 实现灾难恢复现代化——保护 300TB 关键数据,支持每日 72000 多份订单,并实现经过验证的约 4 小时恢复窗口。
浏览这份 IDC 报告,了解网络恢复解决方案中的值得关注的关键功能,以及 IBM® Cloud Cyber Recovery 如何补足现有投资的短板。
了解 IBM Storage Defender 提供的功能以帮助组织构建和提供数据弹性。
本 IBM 红皮书出版物介绍了用于企业数据管理和保护的新 IBM Storage Defender 产品。此 IBM 红皮书出版物可帮助您安装、定制和配置此解决方案,以保护和快速恢复各类数据库,包括 Oracle、Oracle VM (OVM)、Oracle Real Application Cluster (RAC)、SAP HANA、SAP Oracle、SAP Db2、SAP Microsoft SQL、SAP Sybase ASE、Sybase IQ 和 ASE、IBM Db2®、Microsoft SQL、Hadoop、IRIS 和 Cache for EPIC 应用。
IBM 的这份红皮书介绍了 IBM 的全新网络弹性解决方案 IBM Storage Defender Data Resiliency Service (DRS)。通过使用 DRS,用户可以利用其环境中的新检测机制来及早发现威胁,并通过连接 IBM FlashSystem 等主存储阵列和 IBM Defender Data Protect 和 IBM® Storage Protect 等辅助存储解决方案进行备份,从而全面了解基础架构。此外,用户还可以设置治理配置文件,以帮助确保其数据符合内部或监管标准。
了解 IBM Storage Defender 和 IBM® Storage Deep Archive on Diamondback 如何协同实现网络弹性备份、快速恢复和经济高效的长期数据保留。
通过备份、人工智能驱动的威胁检测和快速恢复,保护您的数据免受不断演变的威胁的影响——无论数据位于何处。
加快企业备份和恢复流程,帮助本地和云工作负载快速检索数据和恢复 IT 服务。
借助 IBM 利用丰富的数据和强大的 AI 技术来集成优化流程,从而实现业务运营转型。
通过早期威胁检测、多层保护和快速恢复等功能保护数据安全,并确保工作负载的可用性。了解 IBM® Storage Defender 如何帮助保护信息供应链。
了解有关 Storage Defender 的更多信息
1. 停机隐形成本——根据全球 2000 强高管的观点 ,Splunk,2024 年 6 月
2. 灾难恢复即服务 (DRaaS) 市场规模 ,MarketsandMarkets,2023 年