记一次群晖下WD elements 12T氦气盘更换记录(更新逻辑坏道修复)

一天晚上在看高清原盘,结果蓝光机直接卡死了。重启蓝光机播放到上次时间故障依旧。同时群晖滴滴报警提示硬盘出问题了.

此硬盘为亚马逊海外购小程序 2020.03月 买的WD elements桌面 12T氦气盘拆盒使用.

群晖下RAID类型: BASIC (单盘使用)

对硬盘进行完整SMART检测不能完成。

对存储池2 (此硬盘分配的空间)进行数据清理貌似也没看到结束提醒.

smartctl -A /dev/sda

Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000b   100   100   016    Pre-fail  Always       -       0
  2 Throughput_Performance  0x0004   128   128   054    Old_age   Offline      -       108
  3 Spin_Up_Time            0x0007   154   154   024    Pre-fail  Always       -       425 (Average 427)
  4 Start_Stop_Count        0x0012   100   100   000    Old_age   Always       -       2166
  5 Reallocated_Sector_Ct   0x0033   100   100   005    Pre-fail  Always       -       0
  7 Seek_Error_Rate         0x000a   100   100   067    Old_age   Always       -       0
  8 Seek_Time_Performance   0x0004   132   132   020    Old_age   Offline      -       17
  9 Power_On_Hours          0x0012   094   094   000    Old_age   Always       -       45507
 10 Spin_Retry_Count        0x0012   100   100   060    Old_age   Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   000    Old_age   Always       -       285
 22 Helium_Level            0x0023   100   100   025    Pre-fail  Always       -       100
192 Power-Off_Retract_Count 0x0032   097   097   000    Old_age   Always       -       3971
193 Load_Cycle_Count        0x0012   097   097   000    Old_age   Always       -       3971
194 Temperature_Celsius     0x0002   185   185   000    Old_age   Always       -       35 (Min/Max 5/47)
196 Reallocated_Event_Count 0x0032   100   100   000    Old_age   Always       -       0
197 Current_Pending_Sector  0x0022   100   100   000    Old_age   Always       -       8
198 Offline_Uncorrectable   0x0008   100   100   000    Old_age   Offline      -       4
199 UDMA_CRC_Error_Count    0x000a   200   200   000    Old_age   Always       -       10

问了AI说是有坏道了。建议克隆到另一块大小相同的硬盘上

于是将另一块同样大小的氦气盘和这个问题盘都挂到台式机上, U盘启动 SystemRescue 系统

用以下命令进行转移数据

#第一步(-n 命令):先开高速,把全盘 99.99% 的健康区域一跑到底拉过来,不卡坏道 [[参考:GNU ddrescue Manual, Section 4]]。
ddrescue -b 4096 -d -n -f /dev/sdb /dev/sda /root/clone.map
#第二步(-r3 命令):借助 /root/clone.map 日志,只针对坏道进行 3 次精准挖掘重试,补齐最后的碎片 [[参考:GNU ddrescue Manual, Section 3]]。
ddrescue -b 4096 -d -r3 -f /dev/sdb /dev/sda /root/clone.map

照片数据深度解读

让我们看一下屏幕上的关键数据:

  • rescued: 12000 GB / pct rescued: 99.99%:全盘 12TB 数据中,有 11.99999… TB 的数据被 100% 完好无损地抢救了出来

  • bad-sector: 4096 B(且 bad areas: 1):在全盘 12,000,000,000,000 字节的庞大空间里,仅仅只有 1 个 4KB 扇区(包含之前的坏道)无法读取

  • 损失影响分析:这微不足道的 4KB(约相当于半张极其微小的缩略图大小)已经被 ddrescue 用全零(0x00)安全填充到了新盘对应位置,完全不会影响 GPT 分区表、LVM 阵列结构以及群晖 DSM 系统引导

然后关机将转移之后的硬盘插到群会上。成功开机,也没有报任何错误.

数据转移成功!

接下来准备看看故障盘到底是物理坏道还是逻辑坏道,看看还能不能抢救一下…

—————————-尝试修复———————-
过了几天进PE系统,使用 Victoria 进行全盘扫描,经过20+小时扫描,程序停止并报警,如图

 

AI提示进linux系统dd填零修复。

方案二:用 Linux dd 一次性覆盖后方 10 GB 区域(最快最彻底)

既然坏道在 11.5 TB 处(接近尾部),我们可以直接用 dd 对从 22534635520 开始的后方 10 GB 空间全额写零

在 Live Linux 中运行:

dd if=/dev/zero of=/dev/sda seek=22534635520 bs=512 count=20971520 conv=fdatasync status=progress

 

  • count=20971520:表示连续向后写零 10 GB 的物理空间。

  • 效果:无论这 8 个坏道是挤在一起还是稍微分散在附近几兆字节内,都会被这 10 GB 的零写入一次性全部擦除修复,彻底解决后顾之忧。

跑完之后做一个短时间自检

smartctl -t short /dev/sda

提示等到以下时间之后再看

=== START OF OFFLINE IMMEDIATE AND SELF-TEST SECTION ===
Sending command: "Execute SMART Short self-test routine immediately in off-line mode".
Drive command "Execute SMART Short self-test routine immediately in off-line mode" successful.
Testing has begun.
Please wait 2 minutes for test to complete.
Test will complete after Sat Aug  8 15:42:29 2026 UTC
Use smartctl -X to abort test.

再次看SMART信息

[root@sysrescue ~]# smartctl -A /dev/sda
smartctl 7.2 2020-12-30 r5155 [i686-linux-5.10.46-1.0-lts] (local build)
Copyright (C) 2002-20, Bruce Allen, Christian Franke, www.smartmontools.org

=== START OF READ SMART DATA SECTION ===
SMART Attributes Data Structure revision number: 16
Vendor Specific SMART Attributes with Thresholds:
ID# ATTRIBUTE_NAME          FLAG     VALUE WORST THRESH TYPE      UPDATED  WHEN_FAILED RAW_VALUE
  1 Raw_Read_Error_Rate     0x000b   100   100   016    Pre-fail  Always       -       0
  2 Throughput_Performance  0x0004   128   128   054    Old_age   Offline      -       108
  3 Spin_Up_Time            0x0007   154   154   024    Pre-fail  Always       -       425 (Average 427)
  4 Start_Stop_Count        0x0012   100   100   000    Old_age   Always       -       2167
  5 Reallocated_Sector_Ct   0x0033   100   100   005    Pre-fail  Always       -       0
  7 Seek_Error_Rate         0x000a   100   100   067    Old_age   Always       -       0
  8 Seek_Time_Performance   0x0004   140   140   020    Old_age   Offline      -       15
  9 Power_On_Hours          0x0012   094   094   000    Old_age   Always       -       45537
 10 Spin_Retry_Count        0x0012   100   100   060    Old_age   Always       -       0
 12 Power_Cycle_Count       0x0032   100   100   000    Old_age   Always       -       286
 22 Helium_Level            0x0023   100   100   025    Pre-fail  Always       -       100
192 Power-Off_Retract_Count 0x0032   097   097   000    Old_age   Always       -       3973
193 Load_Cycle_Count        0x0012   097   097   000    Old_age   Always       -       3973
194 Temperature_Celsius     0x0002   162   162   000    Old_age   Always       -       40 (Min/Max 5/47)
196 Reallocated_Event_Count 0x0032   100   100   000    Old_age   Always       -       0
197 Current_Pending_Sector  0x0022   100   100   000    Old_age   Always       -       0
198 Offline_Uncorrectable   0x0008   100   100   000    Old_age   Offline      -       4
199 UDMA_CRC_Error_Count    0x000a   200   200   000    Old_age   Always       -       10

前后对比
ID 197 Current_Pending_Sector 8

修复后
ID 197 Current_Pending_Sector 0

提示硬盘逻辑坏道已经被修复.
后续再观察看看…

上一篇