كيفية إعداد سبب عمل لا يُستهجن لإجراء نسخ احتياطي؟

يمكنك تحديد كيفية تقديم تصميم استمرارية الأعمال المناسب من خلال دخول الموظفين الملتزمين بالعمل. من أجل هذا الهدف، يجب أن تكتشف قدرات التقنيات التي يمكنك استخدامها. بمجرد أن تتعلم ذلك، يمكنك تقدير التكاليف. بعد ذلك، يمكن إعادة هذا التحليل إلى مجموعات العمل لإجراء خطة نهائية توازن بين ما يطلبه منظمو مؤسستك لإنقاذ الظروف الاستثنائية ورغبتهم في دفع الأموال لذلك.

15/12/2023 SintelSedat Akfidan 3 دقيقة قراءة
كيفية إعداد سبب عمل لا يُستهجن لإجراء نسخ احتياطي؟

كيف تصنع مبرراً لا يمكن إنكاره لنسخ احتياطي؟

يمكن للعمالة الموجهة نحو الأعمال أن تحدد كيف يمكن لتقنية المعلومات تقديم تصميم استمرارية العمليات المناسب. من أجل ذلك، يجب أن تكتشف مهارات التقنيات التي يمكن استخدامها.

بعد أن تتعلم ذلك، يمكنك تقدير التكاليف. يمكن أن تعود بهذه التحليلات إلى مجموعات العمل لصنع خطة نهائية توازن بين ما تتطلبه المؤسسة من استعادة الكوارث ومدى رغبتها في دفع ثمن ذلك.

绘制您的备份需求地图可以帮助您计划软件订阅。Hornetsecurity意识到需要多个备份解决方案,并因此为所有关键的 Microsoft 365 服务(包括Exchange邮箱,SharePoint,OneDrive,Teams等)以及 虚拟机备份 提供数据备份和恢复服务。

探索数据保护系统的技术能力

在此阶段,您将拥有一个高级工作项目的抽象列表。为业务应用设计的备份解决方案很少。因此,您需要将此列表分成备份和复制程序能够理解的项目。

为吸引最广泛的客户群,制造商指定了大多数公司使用的服务和产品。常见的保护包括:

  • Windows Server 和 Windows 桌面;
  • UNIX/Linux 系统;
  • 数据库服务器;
  • 邮件服务器;
  • 虚拟机;
  • 基于云的资源;
  • 物理硬件配置。

您需要从优先级业务项目中的基本技术中绘制一张地图。为确保没有遗漏任何内容,请请技术专家参与进来。收集有关如何在您的组织中恢复各种系统的信息。

大多数情况下,它需要比简单的备份和恢复程序更多的努力。一些例子:

  • Active Directory;
  • 基于日志的 SQL 恢复;
  • 邮件服务器;
  • 多层系统;
  • 群集节点。

除了业务应用程序专家外,还应从服务器和基础设施专家那里获取信息。调查与您最信任的系统相关的恢复场景中的经验。您可以发现一些令人惊讶的例外情况或特殊程序。

第一道防线:容错系统

理想情况下,您永远不会需要实施恢复计划。虽然无法完全消除这种可能性,但通过容错系统可以减少其可能性。“故障容忍”是指在存在故障组件的情况下继续运行的能力。

大多数容错系统通常在计算机系统的内部组件中以较低级别运行。为提供保护,通常使用硬件级别的数据复制方法。

在发生故障的情况下,系统会使用备用副本继续提供预期的功能。其中包括多个电源、磁盘和网络接口卡(NIC)等。

但是,直到有人更换故障部件之前,系统不会提供容错功能。更多的故障会导致中断,并可能导致数据丢失。

QR码 - 罪犯的新最佳朋友

存储技术构成了容错系统的大部分。这并非巧合,它们也是失败率最高的组件之一。您可以保护短期存储(主系统内存)和长期存储(旋转和固态磁盘)。

内存故障容忍

为了实现完全的故障容忍,内存控制器可以允许您将内存模块进行匹配。每次对一个模块进行写入操作时,都会在另一个模块中创建相同的副本。如果其中一个发生故障,则另一个可以继续独立运行。

如果计算机在运行时支持内存更换,并且技术人员有无需取出任何东西即可访问内部的方法,那么可以在不中断系统的情况下安装新的模块。

当然,内存仍然是较昂贵的组件之一,并且每个系统都有有限的插槽。因此,使用容错内存会将您的整体负载减半。

增加两倍的主机数量可能会带来比大多数组织愿意承担的更多成本。幸运的是,内存模块的总体故障率较低。与使用更便宜的解决方案解决的临时问题相比,出现重大故障的可能性要低得多。

服务器类计算机通常支持错误校正码(ECC)内存模块。ECC模块包含允许检测和纠正内存错误的技术。

一些供应商提供专门的技术,以防御问题。

在大多数情况下,您会选择ECC内存而不是完全容错的方案。ECC不能防御模块故障,但此类故障很少发生,不足以构成风险。ECC内存比非ECC内存更昂贵,但价格远低于将主机购买成本翻倍。

固态驱动器故障容忍

固态硬盘,特别是传统的磁盘类型,具有很高的故障率。它们存储了几乎所有实时数据,因此需要最多的保护。由于问题的普遍性,工业界为固态硬盘生产了大量容错解决方案。

RAID(独立磁盘冗余阵列)系统构成了大多数固态硬盘故障容忍设计。这些行业标准设计使用以下技术的组合来保护数据:

镜像

每个写入磁盘的位都会在至少另一个磁盘上的相同位置写入。如果一个磁盘发生故障,阵列将使用镜像。

镜像

条带化

每个写入磁盘的位都会在至少另一个磁盘上的相同位置写入。如果一个磁盘发生故障,阵列将使用镜像。

条带化

奇偶校验

奇偶校验也使用条带化模式,但有一个主要区别。每个条带中的一块或多个块包含奇偶校验数据而不是实时数据。操作系统或阵列控制器在写入条带时从实时数据计算奇偶校验数据。

如果阵列中的任何磁盘发生故障,可以使用奇偶校验数据代替实时数据。具有每个条带中奇偶校验块的阵列可以继续运行,即使丢失了一个磁盘。

奇偶校验

如果您想使用RAID,可以选择一系列“级别”。每个RAID级别都提供自己的备份、速度和容量平衡。除了RAID-0(纯条带化,没有备份)之外,所有RAID级别都需要牺牲一部分可用空间来实现保护。

磁盘相比系统内存而言,成本相对较低,并且您可以在系统机箱容量之外有多种扩展选项。因此,尽管RAID在每个存储位上比单磁盘系统成本更高,但通常并不具有压制性。

当谈到RAID时,您有几种选择。由于保护不足,许多级别被降级了,而有些则因占用了太多空间而不具成本效益。您通常会遇到以下几种:

  • RAID-1 – 两个磁盘的简单镜像。写入速度略低于普通,读取速度高于普通,并提供足够的保护,但容量损失为50%。 RAID-1

  • RAID-5 – 一个条带中包含一个奇偶校验块。至少需要三个磁盘。每个条带在交替的磁盘上存储奇偶校验数据,因此在发生故障场景时,只需要计算1/n条带的奇偶校验。可以承受最多一个磁盘丢失。写入速度高于普通,读取速度高于普通,并提供足够的保护,容量损失为1/n。不建议在使用大磁盘的阵列中使用,因为重建过程中发生额外磁盘故障的可能性更高,并且周期性读取(用于检测位错误的预定读取)中发生错误的可能性更高。 RAID-5

  • RAID-6 – 类似于RAID-5,但每个条带有两个奇偶校验块。至少需要四个磁盘。比RAID-5更安全,但在大磁盘中存在类似的问题。比RAID-5慢,并且容量损失为2/n。

  • RAID-10 – 磁盘首先成对镜像,然后将条带写入镜像集的一侧而不使用奇偶校验,并将该条带复制到相应的镜像磁盘中。可以在单个镜像中处理一个磁盘故障,但不能在同一个镜像中处理两个磁盘故障。比奇偶校验方案具有更好的性能和更高的安全性,但容量损失约为50%。 RAID-10

由于磁盘故障的普遍性以及标准备份方案的低性能,许多供应商提供了专门的解决方案来弥补RAID的一些缺点。

在位和块级别上运行的RAID时,大多数供应商特有的系统会添加一些元数据级别的技术以提供保护或性能改进。

在涉及容错磁盘存储时,您有多种选择,因此请记住以下几点:

  • 存储供应商通常希望您购买最高成本的设备。在开始采购之前,请使用规划工具预测容量和性能需求。企业通常会高估空间和性能需求。
  • 在第一次实施后,您几乎总是可以扩展存储空间。不需要像内存那样将自己限制在单个机箱的容量内。
  • 固态磁盘相比旋转磁盘有显著更低的故障率。您可以利用混合系统,包含两者以实现可接受的性能、备份和成本平衡。

最重要的一点是:停机时间会带来金钱损失。存储备份减少了意外中断的可能性。

高级存储故障容忍

随着经济实惠且真正高速网络(十千兆位及以上)的出现,存储保护带来了令人兴奋的新选择。如今的网络速度甚至超过了高端存储设备。

曾经只存在于昂贵SAN设备中的高级存储区域,现在可以在成本较低的机架级别甚至数据中心级别实现备份。

这些技术依赖于数据的实时或同步复制。在最简单的设计中,两个存储单元相互镜像。

依赖这些系统的设备可以连接到虚拟端点进行故障转移,或在同一时间连接到一个单元中的活动/被动配置。在更复杂的架构中,控制系统的将数据分布在多个存储单元,并动态提供访问。

实时复制在“如何使用复制轻松实现业务连续性”一文中详细讨论。

这些技术的最新实例出现在相对较新的超融合解决方案中。它们使用软件将计算层与标准服务器类计算硬件中的存储层结合在一起。

在大多数情况下,它们包含一个虚拟机来控制软件层,并使用专用软件来控制存储。

尽管分布式存储和超融合系统的成本大幅下降,它们仍然位于支出范围的高端。

与传统的独立系统不同,您需要大量的基础设施和技术专业知识来正确支持它们。这些数据可以被评估为“热”副本,可立即更新并快速切换。

某些同步复制系统甚至允许透明故障转移或活动/活动使用。

应用和操作系统故障容忍

在最顶层,您可以将一个操作系统实例镜像到另一个物理系统上。要使这有效,您需要在虚拟化器下运行云服务器,以确保可以镜像活动操作。

这是一个复杂且具有许多限制的架构。很少有虚拟化器支持此功能,它不普遍运行,不能解决所有问题,并且性能提升可能使您最需要保护的应用程序无法运行。

在更可访问的层面上,一些应用程序通过分层允许一定程度的故障容忍。例如,您可以为数据库运行一个Web前端。在发生故障时,可以使用负载均衡器将客户端连接立即转移到另一个Web服务器。

一些数据库服务器甚至允许多个同步实例,以便立即将连接指向活动节点。这些技术在操作系统故障容忍性方面提供了更多的功能和可行性。

在大多数情况下,当应用程序提供自己的内置备份选项时(例如Exchange Server数据库可用性组或SQL Server Always On可用性组),这些总是优先于一般操作系统或超管理器的高可用性选项,如下所示。

故障容忍警告

在探索故障容忍选项时,您会立即注意到其重要成本。几乎所有技术都需要至少两个实例的购买。其中大多数需要额外的基础架构。

它们都依赖于专家进行安装、配置和维护。这些成本应始终与停机时间的成本进行权衡。

故障容忍的主要目的是依靠副本在发生错误时继续运行。但这有一个负面的副作用:您的容错解决方案可能会复制您不想复制的东西。

例如,如果 勒索软件 攻击了您的存储系统,拥有RAID或地理上镜像的SAN不会对您有任何帮助。即使没有恶意行为者,备份系统也可能意外地复制数据损坏或删除与命令相关的关键电子邮件的所有示例。

尽管故障容忍可以对您的组织有益,但不能单独运行。您始终需要使用异步数据复制的备份解决方案。然而,在故障容忍和备份之间,您可以选择选项。这些技术属于高可用性类别。

第二道防线:高可用性

您不能在所有情况下都使用故障容忍。某些系统没有实现它的方法。一些成本过高。相反,您可以部署高可用性解决方案。高可用性具有不太明确的定义,与实际技术相比,更多关注结果。

当故障容忍意味着在发生错误时继续运行时,高可用性则是将实际运行时间与预期运行时间进行衡量。

例如,您希望一个系统始终运行的公司可以设定每年99.99%的可用性目标。要实现这一目标,您需要确保系统在一年内总停机时间不超过几分钟。

365天乘以99.99%,等于364.9635天的运行时间,允许您在大约不到48分钟的时间内发生停机。这是一个激进的目标。

创建高可用性目标时,确保区分是否包含计划内维护。如果您包含这些,那么您的容错能力将大幅减少。

如果达到99.99%的运行时间目标需要系统在补丁循环期间从活动系统到备份系统失败五分钟左右,并且您将其计入度量,那么即使没有意外中断,每年的可用性预期将违反12分钟。

除了为计划维护设置调整外,您还可以调整可用性范围。例如,您可以保持99.99%的目标,但可以指定它仅在周一至周五的06:00-18:00之间有效。您可以排除公司假期。

仔细遵循两个关键步骤:

  • 明确列出例外情况。如果您以大字体设定99.99%的期望,然后巧妙地列出以下条件,最终您将招致那些感到被欺骗和背叛的人的愤怒。一开始就避免这种情况。
  • 明确定义“运行时间”。您应该优先考虑用户经验,但同时也要确保有一个可以客观衡量的标准。例如,“客户可以在网站上完整下订单”是一个很好的抽象目标,但您如何衡量它?如果一个系统故障阻止客户下单,但没有客户尝试,这是否算作停机?如果一位客户下单失败,您如何判断系统是故障的?

从技术角度来看,任何有助于提高运行时间的工具都属于高可用性方案。所有故障容忍技术都是适用的。然而,一些方案允许稍微增加一点停机时间,以换取较低的成本、更广泛的应用和更简单的操作。集群通常是其中最常见的。

使用集群实现高可用性

集群通常在活动/被动配置中使用多个计算机或资源节点来托管单个实例。一些依赖于Microsoft故障转移集群技术的例子:

Microsoft SQL

一个集群化的Microsoft SQL数据库在多个节点中的一个上运行。在计划的故障转移中,当活动节点停止并启动被动节点时,数据库会短时间不可用。如果活动节点发生故障,则在启动被动节点时数据库会短时间断开连接。活动操作可能在计划外的故障转移中下降。

Hyper-V

一个集群化的虚拟机可以在计划的故障转移中快速迁移到另一个节点,可以是在线(动态迁移)或离线(快速迁移)。如果活动节点发生故障,虚拟机会崩溃,但另一个节点可以迅速重新启动它。

文件服务器

标准的集群化Microsoft文件服务器通过一个活动节点快速执行计划和非计划故障转移。Microsoft还提供了一个在更健壮模式下运行的扩展文件服务器。

存储空间直接

通常称为“S2D”的存储空间直接,是Microsoft的分布式文件系统提案。它在Windows Server上运行,适用于常规存储需求。Azure Stack HCI用于提供完整的超融合基础设施解决方案。

您将在其他操作系统、虚拟化器和物理设备中找到集群技术。请注意,它们在允许一定程度的停机时间方面与故障容忍不同。然而,与独立系统相比,它们会大大减少中断风险。

使用集群实现高可用性

集群警告

集群提供了操作层的一个副本。它确保集群化的业务负载有地方运行。它不会创建任何数据副本。如果没有额外的技术,关键存储错误可能导致整个集群失败。

由于需要硬件复制,集群的成本是无集群配置的两倍。启用集群配置可能需要购买额外的软件功能。集群需要有知道如何安装、配置和维护它的人员。

您还应注意,选择的备份解决方案是否能够正确保护您的集群资源。例如,Hornetsecurity的VM备份解决方案可以保护虚拟机集群。有时,您可能成功地使用与高可用性解决方案不兼容的备份解决方案,但这需要更多的管理努力。

使用异步复制实现高可用性

您可以使用技术定期将数据从一个存储单元复制到另一个存储单元。异步复制可以使用快照技术来保持完整的文件系统一致性。一些复制应用程序使用简单的文件复制机制,这对于基本的文件共享足够,但可能无法在应用程序中运行。

一些应用程序内置了异步复制功能。Microsoft的Active Directory会在域控制器之间自动发送更新。大多数SQL服务器都有多种复制选项。Microsoft Hyper-V可以创建、管理和监控虚拟机复制。

使用异步复制生成的数据可以视为“热”副本。在故障后将其恢复在线需要某种形式的操作,但可以快速上线。

异步复制警告

与集群不同,异步复制需要一些人工交互才能在发生故障后切换到副本。集群技术使用某种控制机制来防止两个副本同时运行的分裂脑情况。大多数复制系统中没有内置的方法来做到这一点,因此在选择复制应用程序时,请确保您的计划有所准备。

复制共享集群的主要缺点:重复的硬件、专用软件和专业知识需求。此外,它不提供对数据损坏的保护,如[勒索软件](https://www.horn为防止系统故障,备份是唯一既独立又必要的技术。您可以在没有任何故障容忍或高可用性技术的情况下安全地运行公司,但不能负责任地忽视数据备份和恢复服务。

请注意,以下部分包含许多术语,您需要理解它们。字典包含了您需要的所有定义。

在开始购物之前,请确保了解以下常见备份术语:

  • 完整备份 – 一种完整的、独立的数据副本,可用于恢复所有数据,而无需依赖其他任何数据。
  • 差异备份 – 一种简化的备份,仅