咖啡还没喝,打开QTS:存储池变黄,卷degraded,硬盘栏写着fail。双十一预售刚装进去的新盘,还没捂热。
心里一沉,手就痒:重启?拔盘?重建?先停——这几个动作互相冲突,对一个救命,错一个救死:同样叫掉盘,命运有三种。
报fail不等于盘死了
最常见的是误报。知乎用户momo的双盘RAID1偶发报fail、重启又回来,这条回答播放119万。也有纯噪音,“威联通的nas的hdd硬盘就从没正经休眠过”(67.5万播放)——休眠、供电、背板、兼容,随便一个都能让盘"看起来坏了",重启又生龙活虎。知乎
第二种命运:盘真掉了,但阵列还撑得住。四盘RAID5牺牲一盘换冗余,degraded下照常可读——但这是最后的宽限期。机主天王盖不了地虎的原话:“硬盘报错,出现了坏道,虽然还没有完全报废,但是也得及时更换硬盘并重建阵列才行,不然等彻底寄了就完蛋”。 该重建就现在,别拖。知乎
第三种最难接受:物理损坏。8月3日的知乎帖就是这剧本:双盘位老机突然罢工,“NAS亮红灯,NAS后台不能登录”。 机主把坏盘挂上自装Debian的台式机才读到数据。步骤不展开,他敢折腾的底气很扎眼——“好在数据在夸克网盘里备份过,不慌”。知乎
动手前先查三处
第一个动作该是检查,不是修复:存储与快照,看卷掉到哪级;硬盘SMART,看"重映射扇区"有没有在涨;系统日志与硬盘事件,看掉盘前后发生了什么。
结论分三路:时间和新盘上机、固件升级、搬动机箱重合,SMART干净——按误报处理,重启观察;盘真不见了、阵列degraded,SMART却正常——停掉一切操作,换盘重建;坏道持续增长、日志反复读写报错——别再动手,先保数据等救援。重启和重建互斥,所以先分诊。
RAID不等于数据安全
还有个最该纠正的误区:RAID不是备份,只是可用性冗余。委屈丫丫10月的视频直接开问:为什么说"组了RAID就等于数据安全"是最大的谎言?电研君写得更直白:辛辛苦苦组好的RAID,误删文件时照样救不了你的照片和工作资料。误删、勒索、格式化,阵列救不了,得靠另一条防线。知乎用户Stark-C的思路很干脆:威联通的备份毫无疑问直接使用自家的HBS 3套件即可。 再配快照和一块阵列外的备份盘就够了。哔哩哔哩知乎
威联通近期重心在企业侧:10月8日一台面向中大型企业的QSW-M7230P万兆PoE++交换机发布,上周英特尔峰会又展出QAI-8300 Pro、QAI-6300两款AI NAS。 等新品的,不如先让手里这台稳。微博微博
双十一正是新盘集中进机的窗口,偏偏这轮电子硬件普遍翻倍涨价。 所以盘第一次报fail先别定罪:供电、背板、兼容排一遍再谈盘坏。知乎
最低保险清单:
新盘上机第一周,先把最重要的数据备份出阵列;
看到degraded,先查三处再动手;
SMART坏道在涨,就别赌重建;
备份要独立盘或离线,别只留在阵列里。