Замена диска в NAS: порядок действий, при котором массив выживет
Отказ накопителя — штатная ситуация, ради которой хранилище и покупалось. Но именно во время восстановления массивы чаще всего и гибнут. Разбираем безопасный порядок.
Однажды хранилище пришлёт письмо о том, что один из дисков отказал. Это не авария, а ровно тот случай, ради которого покупался массив с избыточностью: данные целы, система работает, пользователи ничего не заметили.
Дальше начинается процедура, в которой легко наделать ошибок. Разберём порядок, при котором неприятность останется неприятностью.
Первое: не спешить с перестроением
Инстинкт подсказывает немедленно поставить новый диск и запустить восстановление. Инстинкт здесь подводит.
Перестроение — это часы предельной нагрузки на оставшиеся накопители: система вычитывает их целиком, от первого сектора до последнего. Если среди них есть ещё один уставший — а он обычно есть, потому что диски ровесники, — именно тогда он и отвалится.
Поэтому первым делом — свежая копия самого ценного. Массив без одного диска работает и отдаёт данные; воспользуйтесь этим, пока он ещё жив. Несколько часов копирования стоят дешевле суток восстановления из старого бэкапа.
Есть и обратная ситуация, о которой стоит знать: хранилище иногда не выводит диск из массива, а помечает его как проблемный и продолжает работать. Это предупреждение, а не отказ, и оно даёт самое ценное — время. Массив пока с полной избыточностью, копию можно сделать спокойно, замену заказать и провести в удобный день. Игнорировать такое предупреждение не стоит: оно означает, что накопитель уже начал сыпаться, и полный отказ — вопрос недель или месяцев, а не лет.
Как понять, какой именно диск
Ошибиться лотком проще, чем кажется, и последствия у ошибки тяжёлые: вынув исправный накопитель из массива, у которого уже нет избыточности, вы теряете том.
- Откройте раздел состояния накопителей в интерфейсе и найдите отказавший.
- Запишите его серийный номер — именно номер, а не только номер отсека.
- Если аппарат умеет подсвечивать лоток, включите индикацию: это самый надёжный способ.
- Вынув лоток, сверьте серийный номер на наклейке диска с записанным.
- Только после совпадения устанавливайте новый накопитель.
Четвёртый шаг кажется избыточным ровно до первого случая, когда нумерация отсеков в интерфейсе не совпала с физическим порядком лотков. Такое встречается, и цена ошибки несоизмерима с минутой проверки.
Какой диск покупать на замену
Правило простое: той же модели или эквивалентной по характеристикам, объёмом не меньше заменяемого.
- Меньший объём не подойдёт — массив просто не примет накопитель.
- Больший объём примет, но лишнее место останется неиспользованным до замены всех дисков.
- Другая серия допустима, если она рассчитана на круглосуточную работу.
- Другой способ записи — нежелательно: черепичный диск может растянуть перестроение в разы.
Последний пункт стоит проверить по точному артикулу. Производители меняют способ записи внутри одной линейки, и диск с тем же названием, купленный через три года, вполне может оказаться другим внутри.
Горячая замена: когда можно не выключать
Большинство хранилищ с лотками поддерживает замену накопителя на работающем аппарате. Это удобно, но работает не всегда.
Условие одно и жёсткое: у массива должна быть избыточность. Если схема переживает отказ одного диска и один уже отказал, вынимать второй нельзя ни в коем случае — том развалится мгновенно.
Практический порядок для горячей замены: убедиться в интерфейсе, что нужный накопитель помечен как отказавший и выведен из массива; вынуть лоток плавно, без рывка; переставить новый диск и вернуть лоток до щелчка. Система заметит появление накопителя сама и предложит добавить его в массив.
Если аппарат горячую замену не поддерживает или в этом есть сомнения — выключайте. Корректное выключение через интерфейс занимает полминуты и не создаёт рисков вовсе.
Как проходит восстановление
После установки нового накопителя система предложит добавить его в массив. С этого момента начинается перестроение.
Длительность зависит от объёма и типа дисков: на многотерабайтном массиве это часы, а нередко и сутки. Работать с хранилищем в это время можно, но медленно: диски заняты и обслуживают запросы по остаточному принципу.
Прерывать процесс нельзя. Выключение или перезагрузка посреди перестроения в лучшем случае заставит начать сначала, в худшем оставит массив в неопределённом состоянии. Если в доме случаются отключения света, источник бесперебойного питания на время процедуры не роскошь.
Ложная тревога: диск выпал, но исправен
Ситуация встречается чаще, чем настоящий отказ, и выглядит точно так же: накопитель выведен из массива, письмо получено.
Причины бывают разные. Плохой контакт в лотке. Кратковременная просадка питания. Настольный диск, который надолго задумался над сбойным сектором, и контроллер счёл его мёртвым. Во всех этих случаях накопитель физически исправен.
Как отличить: посмотрите показатели выпавшего диска. Нулевые счётчики сбойных секторов и успешная самопроверка говорят в пользу ложной тревоги. Тогда разумно переставить лоток, убедиться в плотной посадке и вернуть диск в массив — система проведёт то же перестроение, но покупать ничего не придётся.
Оговорка: если такое повторяется с одним и тем же накопителем, версию о случайности стоит оставить. Диск, выпадающий из массива регулярно, меняют независимо от того, что показывает диагностика.
Если во время восстановления отказал второй диск
Самый неприятный сценарий, и порядок действий здесь зависит от схемы массива.
Если массив держит отказ двух накопителей — ничего страшного не произошло: избыточность исчерпана, но данные целы. Дождитесь окончания процесса и меняйте второй диск.
Если массив держал отказ только одного — том потерян, и дальнейшие самостоятельные действия обычно делают хуже. Остановитесь, ничего не переставляйте и не пересоздавайте: восстановление данных специалистами возможно, но только пока диски не тронуты. Именно в этот момент и выясняется, насколько свежей была резервная копия.
Замена всех дисков на бо́льшие
Отдельный сценарий: место кончилось, свободных отсеков нет, и единственный выход — поменять накопители на более ёмкие.
Делается это по одному, с полным перестроением после каждой замены. На четырёх дисках это четыре цикла, каждый по несколько часов или суток. Дополнительный объём становится доступен только после последней замены — до этого массив работает по меньшему диску.
Риск здесь очевиден: вы четырежды проводите массив через самый уязвимый период, причём добровольно. Отсюда два правила. Первое: полная свежая копия перед началом, без исключений. Второе: дожидаться полного завершения каждого цикла и не торопить процесс, меняя следующий диск раньше времени.
Альтернатива, о которой стоит подумать: вместо замены всех дисков купить второе хранилище. Выходит дороже, зато не требует многократного перестроения, даёт запас на будущее и попутно решает вопрос территориально разнесённой копии, если поставить аппараты в разных местах.
После восстановления
Процесс завершился, массив снова в порядке. Несколько действий, которые стоит выполнить сразу.
- Запустите проверку целостности всего массива — она найдёт участки, которые перестроение могло пропустить.
- Посмотрите показатели оставшихся дисков: если у соседа начали расти счётчики, планируйте и его замену.
- Проверьте, что резервное копирование не прерывалось во время процедуры.
- Закажите новый запасной диск взамен израсходованного.
- Запишите дату и модель — через три года эта заметка поможет понять возраст каждого накопителя.
Второй пункт особенно важен. Диски одной партии изнашиваются одинаково, и отказ первого — хороший повод внимательно посмотреть на остальные. Плановая замена уставшего соседа в спокойной обстановке обходится несопоставимо дешевле, чем внеплановая через месяц. И последнее наблюдение из практики: после первого отказа в массиве владельцы обычно наводят порядок во всём остальном — проверяют резервные копии, включают уведомления, докупают запасной диск. Правильные выводы, сделанные вовремя, стоят одного потерянного накопителя; беда в том, что делаются они чаще всего только после того, как один раз испугались.
Коротко о главном
- До замены — свежая копия, а не сразу перестроение.
- Определить нужный лоток по серийному номеру, а не по памяти.
- Во время восстановления избыточности нет — это самый опасный период.
Частые вопросы
Что сделать первым делом после отказа диска?
Не перестроение, а свежую копию самого ценного. Массив без одного диска ещё работает и отдаёт данные — этим стоит воспользоваться.
Как не перепутать лоток?
Записать серийный номер отказавшего накопителя, включить подсветку лотка, а вынув его — сверить номер на наклейке с записанным.
Какой диск брать на замену?
Той же модели или эквивалентной, объёмом не меньше. Меньший массив не примет, а лишний объём большего останется неиспользованным.
Можно ли пользоваться хранилищем во время перестроения?
Можно, но медленно, и лучше не нагружать: копирование больших объёмов растягивает процесс и добавляет нагрузку на диски, работающие на пределе.
Что если во время восстановления отказал второй диск?
При схеме с двумя чётностями — ничего страшного. При одной том потерян; остановитесь и ничего не пересоздавайте, пока данные ещё можно спасти.
Что делать после успешного восстановления?
Запустить проверку целостности, посмотреть показатели соседних дисков, заказать новый запасной и записать дату замены.
