记一次群晖下WD elements 12T氦气盘更换记录

一天晚上在看高清原盘,结果蓝光机直接卡死了。重启蓝光机播放到上次时间故障依旧。同时群晖滴滴报警提示硬盘出问题了.

此硬盘为亚马逊海外购小程序 2020.03月 买的WD elements桌面 12T氦气盘拆盒使用.

群晖下RAID类型: BASIC (单盘使用)

对硬盘进行完整SMART检测不能完成。

对存储池2 (此硬盘分配的空间)进行数据清理貌似也没看到结束提醒.

smartctl -A /dev/sda

Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000b   100   100   016    Pre-fail  Always       -       0
  2 Throughput_Performance  0x0004   128   128   054    Old_age   Offline      -       108
  3 Spin_Up_Time            0x0007   154   154   024    Pre-fail  Always       -       425 (Average 427)
  4 Start_Stop_Count        0x0012   100   100   000    Old_age   Always       -       2166
  5 Reallocated_Sector_Ct   0x0033   100   100   005    Pre-fail  Always       -       0
  7 Seek_Error_Rate         0x000a   100   100   067    Old_age   Always       -       0
  8 Seek_Time_Performance   0x0004   132   132   020    Old_age   Offline      -       17
  9 Power_On_Hours          0x0012   094   094   000    Old_age   Always       -       45507
 10 Spin_Retry_Count        0x0012   100   100   060    Old_age   Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   000    Old_age   Always       -       285
 22 Helium_Level            0x0023   100   100   025    Pre-fail  Always       -       100
192 Power-Off_Retract_Count 0x0032   097   097   000    Old_age   Always       -       3971
193 Load_Cycle_Count        0x0012   097   097   000    Old_age   Always       -       3971
194 Temperature_Celsius     0x0002   185   185   000    Old_age   Always       -       35 (Min/Max 5/47)
196 Reallocated_Event_Count 0x0032   100   100   000    Old_age   Always       -       0
197 Current_Pending_Sector  0x0022   100   100   000    Old_age   Always       -       8
198 Offline_Uncorrectable   0x0008   100   100   000    Old_age   Offline      -       4
199 UDMA_CRC_Error_Count    0x000a   200   200   000    Old_age   Always       -       10

问了AI说是有坏道了。建议克隆到另一块大小相同的硬盘上

于是将另一块同样大小的氦气盘和这个问题盘都挂到台式机上, U盘启动 SystemRescue 系统

用以下命令进行转移数据

#第一步(-n 命令):先开高速,把全盘 99.99% 的健康区域一跑到底拉过来,不卡坏道 [[参考:GNU ddrescue Manual, Section 4]]。
ddrescue -b 4096 -d -n -f /dev/sdb /dev/sda /root/clone.map
#第二步(-r3 命令):借助 /root/clone.map 日志,只针对坏道进行 3 次精准挖掘重试,补齐最后的碎片 [[参考:GNU ddrescue Manual, Section 3]]。
ddrescue -b 4096 -d -r3 -f /dev/sdb /dev/sda /root/clone.map

照片数据深度解读

让我们看一下屏幕上的关键数据:

  • rescued: 12000 GB / pct rescued: 99.99%:全盘 12TB 数据中,有 11.99999… TB 的数据被 100% 完好无损地抢救了出来

  • bad-sector: 4096 B(且 bad areas: 1):在全盘 12,000,000,000,000 字节的庞大空间里,仅仅只有 1 个 4KB 扇区(包含之前的坏道)无法读取

  • 损失影响分析:这微不足道的 4KB(约相当于半张极其微小的缩略图大小)已经被 ddrescue 用全零(0x00)安全填充到了新盘对应位置,完全不会影响 GPT 分区表、LVM 阵列结构以及群晖 DSM 系统引导

然后关机将转移之后的硬盘插到群会上。成功开机,也没有报任何错误.

数据转移成功!

接下来准备看看故障盘到底是物理坏道还是逻辑坏道,看看还能不能抢救一下…

上一篇