RAID 阵列硬盘故障恢复标准操作流程(SOP)
文档编号 SOP-RAID-2026-001 版本号 V1.0
编制日期 2026年8月6日 编制人 运维团队
适用系统 Dell PERC 5/i 阵列卡 密级 内部使用
文档状态 正式版 审核状态 待审核
关键词 RAID 1 / RAID 5 / PERC 5/i / 硬盘更换 / 热备重建
1. 目的与范围
本文档详细记录了 Dell 服务器 PERC 5/i 阵列卡在 RAID 1(系统盘)和 RAID 5(数据盘)环境下,因单块硬盘故障导致阵列降级后,通过更换硬盘并设置为全局热备盘触发自动重建,最终恢复阵列冗余的完整操作流程。
适用范围:
● 服务器型号:Dell PowerEdge 系列(配备 PERC 5/i 阵列卡)
● RAID 配置:Virtual Disk 0 = RAID 1(前两块硬盘,系统盘);Virtual Disk 1 = RAID 5(后三块硬盘,数据盘)
● 故障场景:RAID 5 阵列中 03 号硬盘故障,需更换并重建
2. 前置条件与准备工作
2.1 硬件准备
● 同型号或兼容规格的备用硬盘(容量大于等于原硬盘容量)
● 服务器前面板硬盘指示灯可正常显示
● 备用硬盘已确认为空白/无外部配置状态
2.2 软件/工具准备
● 服务器本地控制台或远程管理卡(iDRAC/iLO)访问权限
● 操作系统管理员账户(用于重建完成后验证数据)
● 可选:smartmontools(smartctl)用于操作系统内硬盘健康检查
2.3 风险提示
操作全程严禁断电或重启服务器,否则可能导致阵列彻底崩溃、数据永久丢失。
严禁在 PERC 界面 (PowerEdge RAID Controller BIOS Configuration Utility))执行 Initialization(初始化)操作,该操作将清空整个 RAID 阵列的所有数据。
RAID 5 重建过程中磁盘 I/O 压力显著增加,建议避开业务高峰期操作。
3. 服务器 RAID 环境信息
项目 配置详情
阵列卡型号 Dell PERC 5/i
Virtual Disk 0 RAID 1(镜像)— 系统盘,由 01:00、01:01 两块硬盘组成
Virtual Disk 1 RAID 5(条带+奇偶校验)— 数据盘,由 01:02、01:03、01:04 三块硬盘组成
故障硬盘 01:03(数据盘 RAID 5 中的一块)
故障硬盘状态 故障/Offline(已脱离阵列)
新硬盘状态(更换前) Ready(已清除外部配置,处于待命状态)
新硬盘状态(重建后) Online(已加入阵列,数据同步完成)
重建方式 全局热备盘(Global Hot Spare)自动触发
重建耗时(参考) 约 4~8 小时(取决于硬盘转速、容量及碎片程度)
4. 标准操作流程
4.1 故障确认
步骤 1:确认硬盘故障 (Ctrl+N切换菜单)
开机按 Ctrl+R 进入 PERC 5/i 阵列卡配置界面。
进入 VD Mgmt(虚拟磁盘管理)界面,查看 Virtual Disk 1(RAID 5)状态。
确认状态显示为 Degraded(降级),表示阵列中已有硬盘故障。
进入 PD Mgmt(物理磁盘管理)界面,确认故障硬盘编号及状态(应为 Failed/Offline 或类似异常状态)。
4.2 更换硬盘
步骤 2:物理更换故障硬盘
确认服务器支持热插拔后,直接拔出故障硬盘(01:03)。
若不支持热插拔,需先关机再更换硬盘,更换完成后开机。
插入新的备用硬盘到故障硬盘所在的磁盘槽位。
等待数秒,观察硬盘指示灯是否正常亮起。
4.3 清除新硬盘外部配置
步骤 3:清除新硬盘的外部配置(Foreign Configuration)
进入 PD Mgmt 界面,找到新插入的硬盘(01:03)。
确认该硬盘状态为 Ready(就绪),表示物理连接正常、无坏道、无外部配置。
若状态不是 Ready,选中该硬盘按 F2,选择清除外部配置(Clear Foreign Configuration)操作。
清除完成后,硬盘状态应变为 Ready。
Ready 状态表示硬盘已清除旧配置,处于空闲待命状态,尚未被分配给任何虚拟磁盘。这是正常的中间状态,无需担心。
4.4 触发阵列重建
步骤 4:将新硬盘设为全局热备盘并触发重建
在 PD Mgmt 界面中,选中状态为 Ready 的 01:03 硬盘。
按 F2 进入操作菜单,选择 Make Global Hot Spare(设为全局热备盘)。
确认后,系统会自动将该盘分配给降级的 RAID 5 阵列(Virtual Disk 1),并立即启动重建。
01:03 硬盘状态将从 Ready 变为 Rebuild,表示数据同步正在进行中。
PERC 5/i 阵列卡在 RAID 5 降级状态下,不会直接在虚拟磁盘菜单中提供 Rebuild 按钮,必须通过热备盘机制来触发重建。
4.5 重建过程监控
步骤 5:监控重建进度
在 PD Mgmt 界面中,定期查看 01:03 硬盘的 Rebuild Progress 百分比。
也可在 VD Mgmt 界面中,查看 Virtual Disk 1 的状态是否显示 Degraded (Rebuilding)。
重建过程中严禁断电、重启或进行任何磁盘操作。
重建时间参考:930GB 容量的 RAID 5 阵列通常需要 4~8 小时完成。
建议将服务器安排在非业务高峰期(如夜间)进行重建,以减少对业务的影响。
4.6 重建完成验证
步骤 6:验证阵列恢复状态
当 01:03 硬盘状态从 Rebuild 变为 Online 时,表示重建已完成。
在 VD Mgmt 界面中,确认 Virtual Disk 1 状态已变为 Optimal(最佳)。
确认 Operation 显示为 None,表示当前无后台操作,系统处于稳定运行状态。
所有硬盘(01:00 至 01:04)状态均应显示为 Online。
4.7 操作系统内验证
步骤 7:进入操作系统验证数据完整性
确认 BIOS 中所有虚拟磁盘状态正常后,退出 PERC 配置界面,正常启动操作系统。
进入系统后,检查数据盘盘符是否正常挂载,容量是否正确。
检查关键业务数据文件是否可正常访问,尤其是故障期间可能受影响的数据。
使用 smartctl 等工具检查所有硬盘的 SMART 健康状态和运行温度。
确认无异常日志或告警信息。
5. 重建完成验证清单
在确认阵列完全恢复前,请按以下清单逐项核对:
序号 检查项 预期结果 检查结果
1 PD Mgmt — 01:03 硬盘状态 Online □ 通过
2 PD Mgmt — 所有硬盘状态 全部 Online □ 通过
3 VD Mgmt — Virtual Disk 0(RAID 1)状态 Optimal □ 通过
4 VD Mgmt — Virtual Disk 1(RAID 5)状态 Optimal □ 通过
5 VD Mgmt — Operation None □ 通过
6 操作系统 — 数据盘盘符挂载 正常挂载 □ 通过
7 操作系统 — 关键数据可访问 可正常读取 □ 通过
8 操作系统 — 硬盘 SMART 状态 健康 □ 通过
9 服务器前面板 — 硬盘指示灯 常亮绿灯 □ 通过
6. 注意事项与操作禁忌
6.1 必须遵守的操作规范
● 重建过程中严禁断电、重启或执行任何磁盘操作。
● PERC 5/i 支持断点续传式重建,即使中途因意外暂停,恢复后也会从断点继续,但主动中断仍是高风险行为。
● 重建期间系统可正常运行(在线重建),但建议降低磁盘 I/O 负载,关闭非必要的大规模读写任务。
● RAID 不是备份。即使阵列恢复,仍需确保有异地或离线备份机制。
6.2 严禁操作
严禁执行 Initialization(初始化)操作 — 包括 Start Init. 和 Fast Init.,该操作将永久删除整个 RAID 阵列的所有数据。
严禁在重建过程中删除虚拟磁盘或更改阵列配置。
严禁在重建过程中插拔其他硬盘。
7. 回滚方案与应急处理
若重建过程中出现异常,可采取以下应急措施:
● 重建失败:检查新硬盘是否兼容,确认物理连接正常后,重新执行步骤 3~4。
● 阵列彻底崩溃:若 RAID 5 多盘故障导致阵列不可用,需从备份恢复数据,并联系 Dell 技术支持。
● 数据异常:若进入系统后发现数据不一致,从最近的有效备份恢复受影响的数据。
● 联系支持:如遇无法解决的问题,记录 PERC 界面截图和系统日志,联系 Dell 技术支持获取协助。
8. 后续维护建议
● 定期(建议每月)使用 smartctl 检查所有硬盘的 SMART 健康状态和运行温度。
● 定期检查 PERC 阵列卡日志,确认无预警信息。
● 确认备份策略覆盖所有关键数据,并定期进行备份恢复演练。
● 考虑为 RAID 5 阵列配置全局热备盘,以便在硬盘故障时自动触发重建。
● 建立硬盘生命周期管理制度,关注硬盘使用时长,提前规划更换周期。
9. 修订记录
版本 日期 修订内容 修订人
V1.0 2026-08-06 初始版本,记录 PERC 5/i RAID 1 + RAID 5 环境下的硬盘故障恢复完整流程 运维团队
文章末尾固定信息


评论