① 一句话秒懂

系统弹性、高可用与容错(Resilience / HA / Fault Tolerance)的核心就一句话:消除单点故障(SPOF),让关键系统在 adverse 事件下仍能维持服务——靠 RAID、failover 集群、UPS/发电机,并用”几个九”量化可用性。

② 生活类比

  • SPOF(单点故障) = 整条生产线只有一台关键机器,它一坏全停。
  • RAID = 多块硬盘互相备份,坏一块照样转。
  • Failover 集群 = 两台服务器互为备胎,主的一挂,备的自动顶上(还能 failback 修好归位)。
  • 可用性”几个九” = 一年允许的停机时间:99.9%(三月44分)、99.999%(五月26秒)。

③ 核心概念

三个概念辨析

  • Single Point of Failure(SPOF):任一能使整个系统失效的组件(单盘、单 DB 服务器)。
  • System Resilience(系统弹性): adverse 事件下维持可接受服务的能力;或事件后回到先前状态(如 failover 后原机修好 failback)。
  • Fault Tolerance(容错):遭受故障仍继续运行,靠冗余组件(RAID 磁盘、failover 集群)。
  • High Availability(高可用):用冗余组件在短暂中断后快速恢复,常用负载均衡 + failover 服务器。

可用性量化(”几个九”)

  • 99.9%(三九):30 天月仅容许 <44 分钟停机。
  • 99.999%(五九):月仅容许 26 秒停机。越高越难达成。

保护硬盘:RAID

  • RAID-0(条带):2+ 盘,提性能,无容错
  • RAID-1(镜像):2 盘互备,坏一盘仍可运行。
  • RAID-5(带奇偶条带):3+ 盘,1 盘当量存奇偶,坏 1 盘可重建(变慢)。
  • RAID-6:双分布式奇偶,抗 2 盘失效,最少 4 盘。
  • RAID-10(1+0):镜像+条带,最少 4 盘(偶数),每镜像至少活 1 盘即可。

    容错 ≠ 备份:RAID 阵列整体被毁/误删数据,无备份即全丢。

硬件 RAID 常带 spare 盘(自动热插拔替换)、支持 hot swapping(不关机换盘);cold-swappable 需关机。软件 RAID 便宜但降性能。

保护服务器:Failover 集群

2+ 服务器,一台挂了另一台自动接管(failover)。可多服务器、保护多服务。例:DB1/DB2 故障转移集群 + 3 台 Web 服务器网络负载均衡集群(NLB 既增扩展性也提供部分容错)。云 IaaS 也提供 LB + 健康检查的容错。域控制器互复制 AD、数据库复制也是容错法。

保护电源

  • UPS:电池供电 5–30 分钟,撑到逻辑关机或发电机起。
  • Generator(发电机):长期供电,时长取决于燃料(柴油/天然气/丙烷);需签燃料供应合同(大灾时燃料紧缺)。
  • 定期自测 UPS、审计接入设备数(别”再加一台”超负载)。

Trusted Recovery(可信恢复)

失败后系统仍如失败前一样安全。fail-secure(失败安全,默认阻断)vs fail-open(失败开放,默认放行)——取决于安全还是可用更重要。 Common Criteria 定义四类可信恢复:

  1. Manual Recovery:需管理员手动恢复。
  2. Automated Recovery:系统自恢至少一类故障(如硬件 RAID 自恢硬盘但不恢整服务器)。
  3. Automated Recovery without Undue Loss:自恢且保护特定对象(从事务日志重建、校验完整性)。
  4. Function Recovery:自动恢复特定功能或回滚到安全状态。 系统恢复应 reboot 到单用户/非特权状态,恢复受影响文件/服务、修正分类标签、校验安全关键文件。

QoS(服务质量)

保护网络在负载下的可用性,管理:Bandwidth、Latency、Jitter、Packet Loss、Interference,并优先低容错/高业务需求流量(如高管视频会议优先于实习生视频流)。

④ 真实案例

某高访问网站用 DB1/DB2 故障转移集群(数据存 RAID 提供磁盘容错)+ 三台 Web 服务器 NLB 集群。任一台 Web 服务器挂了,负载均衡器感知后停发流量给它;DB1 挂了 DB2 自动接管。整个架构没有任何 SPOF,恰是”消除单点故障”的范本。

⑤ 考试怎么考

  • SPOF / Resilience / Fault Tolerance / HA 辨析。
  • RAID 各级(0/1/5/6/10)容错能力与最少盘数;RAID ≠ 备份。
  • “几个九”对应停机时间(三九 44 分/月、五九 26 秒/月)。
  • UPS vs Generator 角色;hot swap vs cold swap。
  • Fail-secure vs Fail-open;Common Criteria 四类可信恢复。
  • QoS 五因素。

⑥ 记忆口诀

“消单点,冗余上:RAID 0 快不防,1 镜 5 奇偶 6 双奇,10 镜条四起;容错非备份,阵列毁全丧。UPS 短时发长时,热插拔冷插关。fail-secure 阻断 fail-open 放,可信恢复分四类。可用性几个九:三九44分五九26秒。”

⑦ 自测

  1. 单点故障(SPOF)、系统弹性、容错、高可用四者的区别是什么?
  2. RAID-0/1/5/6/10 各自的容错能力与最少磁盘数?为什么”RAID 不等于备份”?
  3. 99.9% 与 99.999% 可用性分别对应每月允许多少停机时间?
  4. UPS 与发电机分别提供多长时间的电力?为什么发电机需要燃料供应合同?
  5. Fail-secure 与 Fail-open 的区别是什么?Common Criteria 定义了哪四类可信恢复?
  6. QoS 管理的五个网络因素是什么?

This site uses Just the Docs, a documentation theme for Jekyll.