Сколько живёт диск в хранилище и какие показатели предсказывают отказ
Самодиагностика показывает десятки величин, но предсказательная сила есть у немногих. Разбираем, на что смотреть, что игнорировать и почему половина дисков умирает без предупреждения.
Вопрос «сколько проживёт диск» звучит как вопрос о среднем сроке, и ответ обычно дают в виде числа лет. Проблема в том, что среднее здесь мало что описывает: отказы распределены во времени крайне неравномерно, и понимание этой неравномерности полезнее любой средней цифры.
Разберём, как распределены отказы, что показывает встроенная диагностика и на какие из её величин стоит реагировать.
Кривая отказов: три периода
Наблюдения за большими парками накопителей показывают устойчивую картину, которая делится на три отрезка.
| Период | Что происходит | Причина |
|---|---|---|
| Первые месяцы | Повышенная доля отказов | Заводской брак |
| От года до четырёх | Низкий ровный уровень | Плато |
| После пятого года | Доля растёт | Механический износ |
Первый период объясняется просто: дефекты производства проявляются под нагрузкой быстро. Диск, переживший первые месяцы работы, с высокой вероятностью проработает годы.
Отсюда практический приём, известный тем, кто собирает хранилища профессионально: новые накопители перед вводом в работу прогоняют полной проверкой поверхности. Процедура занимает часы, зато выявляет заводской брак до того, как на диск лягут данные.
Третий период — механика. Подшипники вырабатываются, смазка теряет свойства, позиционирование головки ухудшается. Это постепенный процесс, и вот его-то диагностика нередко замечает заранее.
Что показывает самодиагностика
Накопители ведут внутренний журнал состояния — десятки величин, от температуры до числа запусков двигателя. Утилиты показывают их списком, и человек теряется: непонятно, какие значения тревожные, а какие нормальные.
Хорошая новость в том, что предсказательная сила есть у немногих. Исследования больших парков накопителей выделяют устойчивую группу.
- Переназначенные секторы
- Участки, признанные негодными и заменённые из резервной области. Любое ненулевое значение — повод насторожиться, рост со временем — повод менять диск.
- Секторы, ожидающие переназначения
- Прочитались с ошибкой, решение ещё не принято. Самый тревожный из показателей: данные в этих секторах уже под угрозой.
- Неисправимые ошибки
- Участки, которые не удалось прочитать даже с повторными попытками. Прямое основание для замены.
- Ошибки позиционирования
- Головка не встала куда надо. Единичные бывают у здоровых дисков, устойчивый рост — признак износа механики.
Ключевое слово во всех четырёх случаях — динамика. Одно ненулевое значение само по себе не приговор; приговор — это рост от проверки к проверке. Поэтому показания имеет смысл фиксировать: хранилище ведёт историю само, и график красноречивее любой отдельной цифры.
Откуда берутся сбойные секторы
Полезно понимать механику, потому что она объясняет, почему одни показатели тревожны, а другие нет.
Поверхность пластины разбита на секторы, и часть из них негодна уже с завода — это нормально и учтено конструкцией. У каждого диска есть резервная область, из которой контроллер выделяет замену взамен негодного участка. Для операционной системы подмена невидима: адрес тот же, физическое место другое.
Пока замен немного и новые не появляются, всё в порядке. Тревожен именно рост: он означает, что магнитный слой деградирует или механика перестала точно позиционировать головку. Процесс этот лавинообразный: накопитель, у которого счётчик начал расти, обычно не останавливается.
Отдельно про секторы, ожидающие решения. Это участки, которые прочитались с ошибкой, но контроллер ещё не определился: может, случайность, а может, дефект. Пока он думает, данные в этих секторах фактически недоступны. Именно поэтому этот показатель считают самым тревожным из всех.
Чему не стоит придавать значения
Обратная сторона вопроса. Часть величин выглядит пугающе, но с отказами коррелирует слабо.
Температура — при условии, что она в разумных пределах. Вопреки распространённому убеждению, умеренно тёплые диски живут не хуже холодных; опасны крайности в обе стороны и особенно резкие перепады. Практический ориентир: если хранилище стоит не в закрытом ящике и не у батареи, температура вопросов не вызывает.
Наработка в часах сама по себе почти ничего не говорит. Диск с пятью годами ровной работы здоровее диска с двумя годами в тяжёлых условиях. Цифра полезна как контекст, а не как критерий.
Число циклов включения имеет значение только в специфических режимах — например, при агрессивной остановке дисков в простое, когда накопитель запускается и останавливается десятки раз в сутки. Для круглосуточно работающего хранилища этот показатель неинформативен.
Что делать с показаниями на практике
Смотреть в таблицу цифр раз в месяц никто не будет — и правильно. Задача решается настройкой один раз, дальше система следит сама.
- Включите плановую самопроверку накопителей: короткую еженедельно, полную раз в месяц.
- Настройте уведомления на почту по событиям диагностики, а не только по отказам.
- Задайте пороги, при которых система считает диск проблемным, если интерфейс это позволяет.
- Раз в квартал загляните в графики: важна динамика, а не мгновенное значение.
- Держите в запасе один диск той же модели — срок поставки иногда измеряется неделями.
Второй пункт стоит уточнить. Настройки по умолчанию нередко шлют письма только при критических событиях, то есть когда диск уже выпал из массива. Ранние признаки — первые переназначенные секторы, неудачная самопроверка — проходят молча. Именно их и стоит вывести в уведомления: они дают недели форы.
Половина отказов приходит без предупреждения
Неприятная правда, которую стоит принять: значительная часть накопителей выходит из строя внезапно, не показав перед этим ни одного тревожного значения.
Механизмов таких отказов несколько. Отказ электроники платы — мгновенный и полный. Заклинивание двигателя. Механическое повреждение головки. Ни один из них не имеет постепенной стадии, которую могла бы заметить диагностика.
Практический вывод обескураживающий, но важный: мониторинг полезен, однако полагаться на него как на систему раннего предупреждения нельзя. Он ловит постепенную деградацию и не ловит внезапную смерть. Именно поэтому избыточность массива и резервные копии остаются основой, а диагностика — приятным дополнением.
Твердотельные накопители стареют иначе
Всё сказанное относится к механическим дискам. У твердотельных своя логика старения, и путать их не стоит.
Здесь нет подшипников, нет головок, нет позиционирования — а значит, нет и механического износа. Изнашиваются ячейки памяти, и изнашиваются они от записи.
Отсюда другой набор показателей. Главный — остаточный ресурс в процентах и суммарный объём записанных данных. Обе величины накопитель считает сам, и они дают довольно точную оценку: зная темп записи за месяц, можно прикинуть, на сколько лет хватит остатка.
И характер отказа другой. Механический диск чаще предупреждает хотя бы чем-то — звуком, растущими счётчиками, замедлением. Твердотельный по исчерпании ресурса обычно переходит в режим только для чтения, что милосердно, но при отказе контроллера уходит мгновенно и целиком, без шансов на частичное спасение данных.
Когда менять диск
Универсального порога нет, но есть разумные правила, которые применяют на практике.
- Появились ожидающие переназначения секторы — планируйте замену не откладывая.
- Переназначенные секторы растут от проверки к проверке — меняйте.
- Диск выпадал из массива хотя бы раз без внятной причины — повод присмотреться.
- Появились посторонние звуки — щелчки, стрекотание, изменившийся тон гула.
- Наработка перевалила за пять-шесть лет, а данные важные — меняйте планово, не дожидаясь признаков.
Последний пункт вызывает возражения: диск работает, зачем менять? Ответ в экономике. Плановая замена происходит в удобное время, при полной избыточности массива и без спешки. Внеплановая случается тогда, когда случается, и тянет за собой перестроение массива в самый уязвимый период. Стоимость диска против стоимости риска — размен обычно очевидный.
Если диск начал сыпаться
Порядок действий при первых тревожных показаниях определяет, останетесь ли вы с данными.
Первое и главное: не запускать перестроение массива раньше, чем сделана свежая резервная копия. Логика здесь контринтуитивная. Кажется, что надо срочно менять диск и чинить массив, но перестроение — это часы предельной нагрузки на оставшиеся накопители, и если среди них есть ещё один уставший, именно тогда он и отвалится.
Второе: не тянуть с заменой. Разница между «скопировал важное и поменял на выходных» и «отложил до лучших времён» измеряется не удобством, а вероятностью. Диск с растущим счётчиком сбойных секторов деградирует быстро.
Третье: если диск шумит непривычно — щёлкает, стрекочет, гудит иначе — выключайте и не включайте до замены. Механическая неисправность усугубляется каждой минутой работы, и попытки «ещё немного поработать, пока копируется» нередко заканчиваются полной потерей доступа к поверхности.
Гарантия и что она покрывает
Диски продаются с собственной гарантией производителя, и она не связана с гарантией на хранилище. Срок зависит от серии: у потребительских линеек он короче, у серий для хранилищ и корпоративных заметно длиннее.
Что важно понимать: гарантия покрывает замену накопителя, но не восстановление данных. Производитель пришлёт исправный диск и не возьмёт на себя ничего сверх этого. Стоимость потерянного архива гарантией не измеряется вовсе.
Практический момент: срок гарантии — неплохой косвенный признак того, на какой режим работы рассчитан накопитель. Производитель не даёт длинных сроков на продукцию, которая, по его собственным расчётам, их не выдержит. Разница в год-два покрытия между внешне похожими моделями обычно означает и разницу в заявленной наработке.
Есть и обратная крайность, в которую впадают начитавшись подобных статей: менять диски при первом же ненулевом значении любого счётчика. Это тоже не лучшая стратегия. Часть показателей у совершенно здоровых накопителей ненулевая с первого дня — например, счётчик исправленных ошибок чтения, который у некоторых производителей показывает миллионы и означает ровно то, что встроенная коррекция работает как положено. Утилиты трактуют такие величины по-разному и регулярно пугают владельцев красным цветом там, где поводов нет. Ориентироваться стоит на четвёрку показателей выше и на их динамику, а не на общую оценку «здоровья», которую программа выводит по своим внутренним правилам.
Разнесение возраста дисков
Приём, который вытекает из кривой отказов и почти никогда не применяется домашними пользователями.
Диски одной партии, купленные одновременно и работающие в одинаковых условиях, имеют схожий ресурс. Приближаясь к концу срока, они начинают отказывать примерно в одно время — и вероятность потерять второй во время восстановления первого растёт.
Профессиональная практика — разносить возраст: менять накопители не все разом, а по одному с интервалом. Через несколько лет в массиве оказываются диски разного возраста, и одновременный отказ становится маловероятным.
Для домашнего хранилища полный переход на такую схему избыточен, но простой её вариант доступен каждому: покупать диски одной модели, но в разных магазинах или с разницей в неделю. Партии окажутся разными, и это уже снимает основную часть риска. Проверить принадлежность к партии можно по серийным номерам: у накопителей из одного производственного потока они идут подряд или различаются в последних знаках. Если пришли четыре диска с номерами, отличающимися на единицу, — это ровно тот случай, от которого стоило уберечься, и есть смысл попросить замену части комплекта. Магазины к такой просьбе относятся нормально: товар не вскрыт и не использован. Правда, и переоценивать этот приём не стоит: разные партии снижают вероятность совпадения, но не отменяют её. Единственная по-настоящему надёжная страховка от одновременного отказа — схема массива, переживающая потерю двух накопителей, и свежая копия за пределами аппарата. Всё остальное — разнесение партий, мониторинг, плановая замена — снижает вероятность неприятностей, но не отменяет необходимости в этих двух вещах, и подменять одно другим, к сожалению, никак не выйдет — проверено многими владельцами хранилищ на собственном горьком опыте, и повторять этот путь самостоятельно нет никакой нужды.
Коротко о главном
- Отказы распределены неравномерно: опасны первые месяцы и годы после пятого.
- Предсказательная сила есть у четырёх показателей из десятков.
- Около половины дисков отказывают внезапно, без единого тревожного признака.
Частые вопросы
Сколько лет живёт диск в хранилище?
Средняя цифра мало что описывает: отказы сосредоточены в первые месяцы и после пятого года, а между ними держится ровное низкое плато.
На какие показатели смотреть?
На переназначенные секторы, ожидающие переназначения, неисправимые ошибки и ошибки позиционирования. Важно не значение, а его рост со временем.
Опасна ли повышенная температура?
В разумных пределах — нет. Умеренно тёплые диски живут не хуже холодных; опасны крайности и резкие перепады.
Предупредит ли диагностика об отказе?
Не всегда. Значительная часть накопителей отказывает внезапно — отказ электроники или заклинивание двигателя не имеют постепенной стадии.
Когда менять диск планово?
После пяти-шести лет наработки, если данные важные. Плановая замена идёт при полной избыточности массива, внеплановая — в самый уязвимый момент.
Зачем покупать диски из разных партий?
Накопители одной партии имеют схожий ресурс и склонны отказывать примерно одновременно — в том числе во время восстановления массива.
