Набор данных технологии самодиагностики, анализа и отчётности (SMART) для 147 496 жёстких дисков
Шутинг Вэй, Хунчжан Ян, Чжэнгуан Чэнь, Пин Ван
Технологический университет Тяньцзиня, Корпорация ZTE, Пекинский университет
Для исследования прогнозирования отказов жёстких дисков в данной статье представлен набор данных SMART-Z, состоящий из 147 496 записей данных SMART жёстких дисков, периодически собираемых крупным распределённым видеодата-центром в Китае в корпоративной среде применения с марта 2017 по февраль 2018 года. Набор включает 65 моделей жёстких дисков, среди которых 712 отказавших дисков, остальные — исправные. Чтобы минимизировать влияние на бизнес-операции, сбор данных использовал предопределённые списки исключения пиковых часов, многомерный мониторинг и интеллектуальную стратегию защиты для эффективного обеспечения стабильной работы. По сравнению с аналогичными открытыми наборами данных, SMART-Z дополнительно раскрывает такие атрибуты, как критическое значение, наихудшее значение, IP-адрес устройства, бизнес-сценарий, имя буквы диска и другие, что помогает исследователям отслеживать изменение ёмкости жёсткого диска посредством анализа временных рядов, а также реализовывать статистику распределения оборудования по регионам по измерениям бизнес-сценариев, тем самым строя модель прогнозирования отказов жёстких дисков. После проверки наш набор данных демонстрирует только 5.3% пустых данных, превосходя данные по дискам Backblaze ST4000DM000 за 2022 год, где пустые значения составляют 14.78% от общего объёма данных.
Предпосылки и краткое описание
Отказы жёстких дисков обычно делятся на два типа: предсказуемые и непредсказуемые. Последние могут возникать эпизодически, и их трудно предотвратить, например, внезапный отказ микросхемы, механический удар и т.д. Однако износ подшипников двигателя и старение магнитных носителей диска — это предсказуемые ситуации, и эти аномальные явления могут быть обнаружены за несколько дней или даже недель заранее. Технология самодиагностики, анализа и отчётности (Self Monitoring Analysis and Reporting Technology, SMART) использует пороговый метод для мониторинга неисправностей, который сравнивает текущие показатели (или свойства) жёсткого диска с заданным порогом. Если порог превышен, жёсткий диск отправляет предупреждение операционной системе, давая пользователю время для переноса важных данных на другие устройства хранения. В 1995 году компания Compaq представила это техническое решение комитету Small Form Factor (SFF) для стандартизации, и оно стало техническим стандартом для автоматического мониторинга целостности жёстких дисков и отчёта о потенциальных проблемах.
Технический принцип SMART заключается в сборе информации с различных датчиков на жёстком диске и хранении этой информации в служебной области системы жёсткого диска. Эта область обычно находится в первых нескольких десятках физических дорожек на физической поверхности 0 жёсткого диска и записывается производителем диска в соответствующую внутреннюю управляющую программу. Помимо таблицы информации SMART, туда также входят программы низкоуровневого форматирования, шифрования и дешифрования, самодиагностики, автоматического восстановления и т.д. Программное обеспечение для мониторинга, используемое пользователем, считывает информацию SMART через команду «SMART Return Status» и не позволяет никому изменять эту информацию. Идентификационный код для обнаружения SMART жёстких дисков представляет различные параметры обнаружения жёсткого диска двумя шестнадцатеричными цифрами.
Хотя пороговые значения SMART могут предупреждать об отказах жёстких дисков, их точность недостаточна. В последние годы исследователи предложили множество методов прогнозирования отказов жёстких дисков на основе данных SMART и алгоритмов машинного обучения. Используемый ими набор данных для прогнозирования отказов жёстких дисков обычно происходит из данных SMART, опубликованных компанией Backblaze. В качестве примера можно взять данные, опубликованные в четвёртом квартале 2024 года: система хранения имеет 30 различных марок и моделей жёстких дисков, и этот набор данных стал широко признанным сторонним набором данных для прогнозирования отказов жёстких дисков. Набор данных Backblaze содержит исходное значение RAW_VALUE для каждого идентификатора SMART, нормализованное значение VALUE и метку, указывающую, произошёл ли сбой. Хотя количество и масштаб жёстких дисков велики, категория включает только диски SATA, а критические значения и наихудшие значения для каждого атрибута не были обнародованы. Категория SMART-Z, раскрытая в этой статье, включает диски SATA и диски SAS, всего 65 различных марок и моделей жёстких дисков. Типы жёстких дисков относительно разнообразны и превосходят набор данных Backblaze.
Аналогично, в 2013 году Baidu выпустил набор данных SMART, содержащий 23395 жёстких дисков SATA, все модели Seagate ST31000524N. Частота сбора этого набора данных — раз в час, собирались только данные SMART с жёсткого диска, без других показателей. Недостаток в том, что все жёсткие диски одной марки и модели, и предложенная им модель прогнозирования неприменима к другим маркам и моделям.
Сиди Лу и др. впервые продемонстрировали, что, комбинируя информацию о местоположении жёсткого диска с атрибутами SMART, можно с высокой точностью прогнозировать отказы жёстких дисков. Потому что диски, находящиеся в схожих физических пространствах, с большей вероятностью подвержены влиянию одинаковых факторов окружающей среды, таких как относительная влажность и температура, и могут испытывать схожие уровни вибрации. Хотя вибрация не является частью атрибутов SMART, она может влиять на надёжность жёсткого диска. Следовательно, добавление информации о местоположении может выявить диски, работающие в сходных условиях или режимах эксплуатации, которые могут демонстрировать схожие характеристики отказов.
Кроме того, продолжительность работы жёсткого диска (включенного состояния) также может оказывать определённое влияние на его срок службы. Длительная работа диска (даже в режиме простоя) может вызывать утечку заряда и приводить к перегреву, ускоряя старение жёсткого диска. Длительная эксплуатация диска также может увеличивать риск ошибок микропрограммы.
Поэтому, чтобы предоставить больше возможностей для методов прогнозирования отказов жёстких дисков, SMART-Z опубликовал данные SMART жёстких дисков из крупного распределённого видеодата-центра в Китае с марта 2017 по февраль 2018 года. Данные состоят из трёх csv-файлов: log_hdsmart_base.csv, log_hdsmart_param.csv и offline_hdsmart.csv, которые отображают основную информацию о жёстком диске, информацию SMART жёсткого диска и информацию об отказавших дисках. Набор данных SMART-Z добавляет к набору данных Backblaze различные атрибуты, такие как Пороговое значение (Threshold), Наихудшее значение (Worst), IP-адрес устройства (omcip), Бизнес-сценарий (bureau), имя диска (czname), время работы отказавшего диска (powerontime). Исследователи могут изучать неисправные жёсткие диски с нескольких измерений и обнаруживать их потенциальные закономерности на основе набора данных SMART-Z, предложенного в этой статье: отслеживать тенденцию изменения ёмкости жёсткого диска с помощью анализа временных рядов; использовать измерения бизнес-сценариев для реализации статистики регионального распределения устройств; сравнивать надёжность оборудования производителя на основе полей модели и типа; влияние накопленного времени работы на отказавший жёсткий диск; на этой основе можно построить модель прогнозирования отказов жёстких дисков для заблаговременного выявления устройств высокого риска, а связь между именами букв дисков и IP-адресами устройств предоставляет критически важный путь для локализации неисправностей.
Из-за эксклюзивности получения команд SMART для жёстких дисков (таких как smartcli) их вызов может вызывать дрожание производительности системы. Сбор SMART со всех жёстких дисков по фиксированному циклу неизбежно потребляет большое количество системных ресурсов за короткий период времени. После тестирования время задержки сбора SMART с 10000 жёстких дисков одновременно практически неприемлемо, в течение которого система практически не может реагировать на нормальные операции чтения-записи и иногда испытывает простои. Учитывая вышеуказанные проблемы получения данных SMART с жёстких дисков, в данной статье при сборе изолируется смежный сбор данных на основе временных окон, и предпринимается попытка распределить дрожание производительности, вызванное сбором информации с жёстких дисков, в пределах временного окна. При соблюдении необходимой частоты сбора для прогнозирования отказов жёстких дисков негативное влияние сбора информации с жёстких дисков на фронтальный бизнес минимизируется насколько это возможно.
Методы
В этом разделе мы описываем процесс сбора, лежащий в основе набора данных для прогнозирования отказов жёстких дисков. С помощью автоматизированной системы мониторинга жёстких дисков мы периодически собираем данные SMART и связанную с ними управленческую информацию (такую как бизнес-сценарии), обрабатываем их и получаем набор данных для прогнозирования отказов жёстких дисков, представленный в данной статье. Набор данных, раскрытый в этой статье, получен от корпорации ZTE, организации третьего автора. Мы периодически собирали 147 496 данных SMART жёстких дисков в корпоративной среде применения с марта 2017 по февраль 2018 года.
Сбор данных. Система использует стратегию выборки на основе временных окон и метод сбора с фиксированным периодом, каждый жёсткий диск собирает данные один раз в день. Чтобы избежать помех производительности в пиковые периоды служб видеовоспроизведения, в этой статье установлены периоды высокой активности (11:00–14:00, 18:00–23:00) через предопределённый список исключения пиковых периодов (BUSY_TIME_LIST) и используется модуль проверки часов реального времени, чтобы избегать периодов высокой параллельной нагрузки и приостанавливать сбор данных.
Программа сбора данных запускается непосредственно на уровне системы через сценарии, сначала автоматически идентифицируя все активные блочные устройства хранения в системе. Процесс обнаружения устройств опирается на встроенные инструменты командной строки, которые могут динамически адаптироваться к различным типам интерфейсов, включая SATA и SAS, обеспечивая полный охват диапазона сбора и адаптацию к различным устройствам жёстких дисков, с хорошей аппаратной совместимостью. После завершения идентификации устройств система входит в процесс периодического опроса. В пределах действительного окна выборки система устанавливает 20-секундный порог тайм-аута для операции с одним жёстким диском, чтобы предотвратить зависание процесса. Учитывая, что методы резервного копирования, представленные снапшотами, часто запускают таймеры в начале часа или получаса, сбор в этот период следует избегать. Поэтому каждое время сбора — это 5–25 минут и 35–55 минут. Учитывая параллелизм сбора данных, желательно избегать одновременного сбора данных со всех жёстких дисков. Поэтому с интервалом в 10 секунд следует собирать информацию SMART с 50–100 жёстких дисков каждый раз, одновременно считывая информацию о подключении устройств (например, IP-адрес устройства) на уровне операционной системы. Таким образом, общий процесс сбора заключается в сборе информации smart с 50–100 жёстких дисков каждые 10 секунд в 5–25 минут и 35–55 минут каждого часа в непиковое время, так что каждый жёсткий диск сканируется один раз в день в разные периоды времени, а не каждый час. Для полей бизнес-сценариев система будет выполнять сравнение в реальном времени с конфигурационной базой CMDB, чтобы гарантировать точность логических отношений атрибуции. Учитывая снижение бизнес-нагрузки, запускать трудоёмкие операции, такие как обновление моделей, объединение записей и удаление выборок, вне пиковых периодов. Данные SMART собираются с помощью инструмента smartctl, охватывая показатели, сильно связанные со статусом работоспособности, такие как количество переназначенных секторов, количество секторов, ожидающих обработки, и температура жёсткого диска. Стоит отметить, что эта статья включает три типа жёстких дисков: SATA_HDD, SATA_SSD и SAS_HDD, которые имеют небольшие различия при сборе атрибутов SMART. Диски типов SATA_HDD и SATA_SSD могут напрямую просматривать всю информацию SMART жёстких дисков через оператор сбора smartctl -a /dev/<устройство>, но содержание результатов сбора сильно различается. Подробные различия функций SMART можно увидеть в Таблице 3. Диски SAS_HDD обычно управляются через RAID-контроллеры LSI/Avago/Broadcom, что требует предварительного подтверждения номера диска через lsscsi -g, а затем использование оператора сбора smartctl -a -d megaraid, /dev/ для получения информации SMART для жёсткого диска.
Критическое значение и наихудшее значение. Помимо записи исходных показателей, этот метод также разрабатывает механизм динамического отслеживания экстремальных значений, чтобы фиксировать максимальные аномальные значения, которые возникали для каждой позиции ID в течение всего периода мониторинга при работе жёсткого диска. Наихудшее значение — это максимальное аномальное значение, которое возникало для каждой позиции ID во время работы жёсткого диска. Путем выполнения операций сравнения в реальном времени с пиковой статистикой деградации данных во время работы жёсткого диска значение постоянно обновляется. Наихудшее значение может характеризовать экстремальные нагрузки или состояния деградации, испытанные устройством, которые часто невозможно получить только через единичное моментальное наблюдение. Обычно наихудшее значение равно текущему значению. Если наихудшее значение значительно колеблется, это указывает на то, что жёсткий диск испытывал ошибки или суровые рабочие условия (например, температура). Кроме того, критическое значение — это пороговое значение, заданное производителем жёсткого диска для представления надёжности определённого проекта, также называемое порогом, которое рассчитывается по специальной формуле. Если текущее значение параметра приближается к критическому значению, это означает, что жёсткий диск станет ненадёжным, что может привести к потере данных или отказу жёсткого диска.
Обнаружение выбросов. Эта статья эффективно обеспечивает стабильную работу системы сбора данных жёстких дисков посредством многомерного мониторинга и интеллектуальных стратегий защиты. В области обнаружения процессов-зомби система инновационно построила трёхмерную модель мониторинга состояния, которая комплексно оценивает с трёх измерений: жизненный цикл процесса, шаблон использования ресурсов и характеристики блокировки ввода-вывода. Когда время работы процесса превышает удвоенный цикл сбора, использование ЦП остаётся выше 90% в течение пяти циклов или очередь ожидания ввода-вывода превышает 10 задач, система автоматически помечает его как аномальный процесс. В ответ на эти аномальные процессы система выполняет операции принудительного завершения аномальных процессов и обновляет список аномальных жёстких дисков в реальном времени, чтобы гарантировать, что проблемные жёсткие диски могут быть изолированы и обработаны своевременно. В области защиты от тайм-аута используется базовый порог тайм-аута в 20 секунд, и на основе текущего количества управляемых жёстких дисков вносятся динамические корректировки на логарифмическом уровне. Благодаря этому интеллектуальному управлению тайм-аутом система может поддерживать стабильные возможности сбора данных в сложной и изменчивой операционной среде, не прерывая нормальные операции из-за строгих пороговых установок или позволяя аномальным процессам занимать ресурсы из-за слабых порогов.
В то же время, в сценариях тайм-аута или аномальных процессов система не может читать данные SMART или может читать только некоторые ненадёжные старые кэшированные данные SMART, поэтому система явно не может читать действительные данные SMART. В этом случае сценарий отдаёт приоритет стабильности и предпочтёт пропустить подозрительные жёсткие диски, а не записывать ненадёжные данные. Существующая логика позволяет избежать зависания сценария или загрязнения данных из-за отключения жёсткого диска, что соответствует требованиям устойчивости мониторинговых сценариев.
Конфигурация ключевых параметров. Основные параметры конфигурации сценария во время процесса сбора показаны в Таблице 1.
Записи данных
Этот набор данных можно найти в рамках открытой науки (https://doi.org/10.17605/OSF.IO/2476G). DOI — DOI 10.17605/OSF.IO/2476G, и присвоена лицензия CC-Py Attribution 4.0 International. Он включает данные жёстких дисков, обработанные крупным распределённым видеодата-центром в Китае с марта 2017 по февраль 2018 года. Набор данных состоит из нескольких файлов, каждый из которых соответствует определённым категориям данных, перечисленным ниже. Подробная структура организации файлов показана на Рис. 1.
- log_hdsmart_base.csv: Этот файл содержит 14 525 830 записей основной информации о жёстких дисках. Каждая строка данных — это сканирование и сбор данных с одного жёсткого диска в определённый день, включая другую информацию о жёстком диске, кроме атрибута SMART. Конкретные данные SMART жёсткого диска см. в log_hdsmart_param.csv. Основные поля: серийный номер жёсткого диска (keyHDid), время сбора (keyScanTime), IP-адрес устройства (omcip), имя буквы диска (czname), тип жёсткого диска (Type), модель жёсткого диска (Model), ёмкость жёсткого диска (Capacity), бизнес-сценарий (bureau).
- log_hdsmart_param.csv: Этот файл содержит 195 840 912 записей информации SMART для жёстких дисков в разные месяцы. Каждый SMART_ID представлен отдельной строкой, и несколько последовательных строк могут быть одним сбором SMART с одного и того же диска. Поскольку SMART_ID разные, генерируется несколько строк. Основные поля: серийный номер жёсткого диска (keyHDid), время сбора (keyScanTime), SMART_ID, SMART_NAME, стандартное значение, соответствующее текущему SMART_ID (value), наихудшее значение (worst), критическое значение (threshold), исходное значение, соответствующее текущему SMART_ID (rawvalue), уровень предупреждения SMART (type), метод обновления SMART (update).
- offline-hdsmart.csv: Этот файл содержит информацию о 712 отключённых (оффлайн) жёстких дисках, с основными полями, включающими бренд, бизнес-сценарий (bureau), ёмкость жёсткого диска (capacity), тип устройства (devicetype), тип диска (disktype), серийный номер жёсткого диска (hdid), модель жёсткого диска (hdnum), время отключения диска (lastlogtime), IP-адрес устройства (omcip) и время работы (powerontime).
- example script: Эта папка содержит простые файлы сценариев и их описательные документы для обработки CSV, предоставленные нами.
- 1_classification.py: Этот сценарий извлекает три различных типа жёстких дисков и сохраняет их в разных CSV-файлах, чтобы облегчить исследователям прогнозирование отказов для различных типов жёстких дисков.
- 2_filter_feature.py: Этот сценарий выполняет фильтрацию признаков в CSV-файлах, содержащих атрибуты SMART, в основном удаляя признаки в наборе данных, которые полностью пусты и имеют дисперсию 0.
- 3_XGBoost.py: Сценарий сначала помечает неисправный диск как 1, а исправный — как 0, и выполняет обработку дисбаланса выборок на алгоритмическом уровне для набора данных, используя XGBoost для прогнозирования отказов.
- Code_collect_disk_data.sh: Этот сценарий оболочки — код для сбора набора данных для прогнозирования отказов жёстких дисков и может быть запущен в среде Linux.
Конфигурация ключевых параметров
Из-за периодических отключений, вызванных ненадёжным питанием или соединительными проводами, в файле log_hdsmart_base.csv начальное время сбора для каждого серийного номера жёсткого диска может быть разным. Один и тот же диск может появляться в файле несколько раз из-за ежедневного сбора. Со временем бизнес-сценарий и IP-адрес устройства для одного и того же жёсткого диска могут меняться.
В файле log_hdsmart_param.csv поле type используется для различения уровня предупреждения об отказах параметров SMART, с двумя значениями: Old_age и Pre_fail. Old_age означает, что атрибут SMART отражает регулярное старение или долговременный износ жёсткого диска. Изменения таких атрибутов — ожидаемое нормальное явление и не приведут к немедленному отказу жёсткого диска, но аномальные значения могут указывать на приближение конца срока службы. А Pre_fail означает, что атрибут SMART является индикатором раннего предупреждения об отказах жёсткого диска, и аномальные значения могут указывать на неизбежный отказ. То есть, если атрибут SMART, помеченный как Pre_fail, является аномальным, это обычно расценивается как отказ, в то время как если атрибут SMART, помеченный как Old_age, является аномальным, требуется длительное наблюдение для вынесения суждения. Следует отметить, что один и тот же атрибут SMART у разных моделей жёстких дисков одного производителя может иметь разные уровни предупреждения. Например, SMART ID 7 модели WDC WD4002FYYZ-01B7CB0 помечен как Old_age, а SMART ID 7 модели WDC WD4002FYYZ-01B7CB0 помечен как Pre_fail.
Следует подчеркнуть, что в файле offline-hdsmart.csv все жёсткие диски являются отключёнными (оффлайн) дисками. Если серийный номер жёсткого диска не появляется в файле, предполагается, что это исправный жёсткий диск. Учитывая сложность отказов жёстких дисков, не существует общепринятого определения для отказов жёстких дисков?. Поэтому в
этой статье мы объявляем только все отключённые диски. Стандарт отключения жёсткого диска в данной статье относится к частому возникновению одного или нескольких типов проблем: механический шум, высокая температура, серьёзная аномалия свойств SMART жёсткого диска, потеря данных, ошибки чтения-записи, медленное чтение-запись (т.е. время ожидания запросов чтения-записи в очереди превышает 1,5 секунды 20 раз подряд), частые отключения, запись в журнал файловой системы Medium_Error, I/O_Error, Critical_target_error, Metadata_I/O_Error и другой информации о тревогах, невозможность монтирования, отсутствие реакции на операции чтения-записи и т.д., из которых медленное чтение-запись является наиболее распространённым.
Некоторые исследователи считают, что отказ жёсткого диска относится к проблеме самого жёсткого диска, например, повреждение головки и отсутствие вращения двигателя. Другие считают, что помимо отказа самого жёсткого диска, он также включает отказ, вызванный внешними причинами, такими как обрыв соединения из-за плохого контакта интерфейсного кабеля жёсткого диска. Поэтому мы не стали напрямую определять и устанавливать метку отказа, это было проанализировано самими исследователями в соответствии с требованиями к отказам жёстких дисков и в сочетании с файлами log_hdsmart_base.csv и log_hdsmart_param.csv. Для удобства дальнейшего описания мы временно предположим, что все отключённые диски являются неисправными дисками.
Этот набор данных включает три типа жёстких дисков: SAS_HDD, SATA_HDD и SATA_SSD, всего 65 моделей жёстких дисков. Модели и соответствующие им количества исправных и неисправных дисков показаны в Таблице 2.
Детали жёстких дисков
В жёстких дисках типа SATA_HDD в основном 18 функций SMART, в дисках типа SAS_HDD в основном 4 функции SMART, а в дисках типа SSD в основном 26 функций SMART. Подробные атрибуты SMART показаны в Таблице 3.
Из данных таблицы и результатов сбора следует отметить несколько моментов:
(1) Низкоуровневый инструмент сбора SAS практически не может собирать никакой информации, что приводит к меньшему количеству атрибутов SMART у SAS_HDD.
(2) Многие атрибуты SMART, собранные низкоуровневым инструментом сбора SDD, являются Unknown_Attributes, например, SMART_ID 170-174, 225-227, 234, 243.
(3) Один и тот же ID для разных брендов может иметь разное значение. SMART_ID 175 означает Power_Loss_Cap_Test в SEAGATE и Program_Fail_Count_Chip в WDC.
(4) Один и тот же ID одного бренда, но разных моделей, может иметь разное значение. Например, в INTEL SSDSC2BB480G6 он представляет Runtime_Bad_Block, а в INTEL SSDSC2BB480G4 он представляет SATA_Downshift_Count.
Стоит отметить, что SMART — это технология для анализа и мониторинга состояния различных компонентов жёсткого диска, таких как магнитные головки, двигатели, пластины и т.д. Однако не все атрибуты SMART связаны с отказами жёстких дисков, и некоторые мешающие признаки могут оказывать негативное влияние на точность прогнозирования. Чтобы помочь исследователям исключить некоторые признаки, мы проанализировали некоторые из них, результаты показаны на Рис. 2.
Из рисунка (а) видно, что существует чёткое различие в числовом изменении SMART ID 175 между неисправными и исправными жёсткими дисками, в то время как на рисунке (b) числовое изменение SMART ID 5 равно 0 и постоянно на обоих типах дисков и не оказывает положительного эффекта на различение неисправных и исправных дисков. Из этого мы заключаем, что наличие мешающих признаков может влиять на точность прогнозирования. Кроме того, если для моделирования машинного обучения использовать неподходящие признаки, это не только не окажет положительной помощи в прогнозировании отказов, но также может вызвать путаницу в результатах прогнозирования. Поэтому необходимо выполнять разумную фильтрацию признаков для собранной информации SMART. С одной стороны, можно удалить избыточные атрибуты, уменьшить размерность ввода и снизить сложность модели. С другой стороны, это может улучшить прогностическую производительность модели.
В файле log_hdsmart_base.csv всего 44 записи информации о бизнес-сценариях, которые включают все бизнес-сценарии, задействованные жёсткими дисками в этом наборе данных, как показано в Таблице 4.
Таблица 4 показывает информацию о 44 бизнес-сценариях. Конкретные поля состоят из провинция_оператор_номер оборудования, где оператор включает DX, YD и LT. Например, Anhui_DX_10012 означает, что жёсткий диск из дата-центра с номером 10012, развёрнутого China DX в провинции Аньхой.
Функции SMART
Информация о бизнес-сценариях
Информация о бизнес-сценарии содержит информацию о физическом месте развёртывания жёсткого диска. Жёсткий диск в одном бизнес-сценарии будет подвержен влиянию одних и тех же факторов окружающей среды, таких как температура, влажность, пыль и частицы, что делает так, что если один из жёстких дисков в одном бизнес-сценарии выходит из строя, диски в том же сценарии также могут выйти из строя по той же причине, то есть жёсткие диски в одном бизнес-сценарии могут сформировать
«общий риск» из-за факторов окружающей среды. При анализе отказов жёстких дисков исследователи могут комбинировать информацию о бизнес-сценариях с данными SMART жёсткого диска, чтобы установить многомерную корреляционную модель для повышения точности прогнозирования.
Эта статья не помечает набор данных, и исследователи могут устанавливать соответствующие временные окна в соответствии со своими потребностями. Количество неисправных и исправных дисков в файле показано в Таблице 5.
Соотношение жёстких дисков
Как видно из таблицы, соотношение положительных и отрицательных выборок для неисправных и исправных дисков составляет 146 784:712, что указывает на дисбаланс выборки. Если это не обработать, большое количество жёстких дисков будет определено моделью прогнозирования отказов как исправные диски, поэтому неисправные диски не могут быть хорошо обнаружены. Исследователи могут улучшить модель, внося улучшения как на уровне данных, так и на алгоритмическом уровне, тем самым достигая лучшей модели прогнозирования отказов жёстких дисков. Методы обработки дисбаланса выборок, которые могут быть приняты, включают, но не ограничиваются следующими:
(1) Методы передискретизации (oversampling): включая SMOTE, Borderline-SMOTE, M-SMOTE, ADASYN и другие методы, эти методы выбирают ключевые образцы малого класса в соответствии с разными критериями для генерации новых образцов.
(2) Методы недодискретизации (undersampling): включая случайную недодискретизацию (Random under-sampling), недодискретизацию на основе информации о соседях образцов, недодискретизацию на основе кластеризации и другие методы, которые уменьшают количество образцов в больших категориях для достижения баланса данных.
(3) Комбинированные методы передискретизации и недодискретизации: включая SMOTE + ENN и SMOTE + Tomek, которые используют преимущества недодискретизации для удаления шумовых данных, сгенерированных передискретизацией.
(4) Метод обучения с учётом стоимости (cost-sensitive learning): путём настройки функции стоимости модели, ошибочная классификация образцов малого класса имеет более высокую стоимость, и ограничивается смещение, вызванное дисбалансом классов.
(5) Метод ансамблевого обучения (ensemble learning): из категорий с большим размером выборки случайным образом выбирается определённое количество образцов, и они комбинируются с категориями с малым размером выборки для обучения нескольких моделей. Наконец, для генерации результатов классификационного прогноза используется метод голосования или взвешенного голосования.
(6) Метод обнаружения аномалий (abnormal detection): фокус метода обнаружения аномалий заключается не в улавливании различий между классами, а в нахождении характеристик класса, который нас интересует. Те, которые не соответствуют этим характеристикам, могут быть засчитаны как другой класс.
С помощью обработки дисбаланса выборок мы можем получить полезную информацию в случае огромного дисбаланса между неисправными и исправными дисками, чтобы достичь лучшего эффекта прогнозирования отказов жёстких дисков.
Техническая проверка
Эксперимент с единичным сбором. Чтобы проверить обоснованность частоты сбора, используемой в этой статье. Во время тестирования используется инструмент стресс-тестирования ввода-вывода с открытым исходным кодом FIO для выполнения записи фиксированной гранулярности (8 КБ) на одном жёстком диске в течение 180 секунд, запуская сбор SMART жёсткого диска каждые 8–12 секунд. Используется метрика await в команде iostat как основа для определения, вызывает ли это помехи. Await — это среднее время ожидания (в миллисекундах) для каждой операции ввода-вывода, которое включает время, проведённое в очереди ввода-вывода ядра, и время выполнения ввода-вывода на устройстве хранения. При условии фиксированной гранулярности записи время выполнения ввода-вывода на жёстком диске почти не отличается. Однако при сборе данных SMART с жёсткого диска длина очереди ввода-вывода будет увеличиваться. Ожидается, что тест в этой статье вызовет внезапный рост значения await в момент сбора.
Как показано на Рис. 3, единичный сбор SMART жёсткого диска не вызвал блокировки чтения/записи или аномалий, лишь вызвав мгновенное дрожание в await, но уровень дрожания не достиг неприемлемого уровня. Поэтому в данной статье полное сканирование диска выполняется с интервалом в 1 час каждый день, и данные собираются с интервалом в 10 секунд. Каждый раз собирается информация SMART с 50–100 жёстких дисков, избегая при этом загруженных периодов фронтальной бизнес-системы. Эта стратегия обоснована.
Эксперимент по сбору различного количества. Как показано на Рис. 4, в этой статье было протестировано время дрожания производительности, испытываемое системой хранения при сборе данных SMART с жёстких дисков. Традиционный метод сбора данных SMART с 10000 жёстких дисков одновременно вызвал бы дрожание производительности в 6440 миллисекунд, в то время как метод, предложенный в этой статье, может контролировать это число в пределах 100 миллисекунд.
Эксперимент по помехам для видеосервисов. Этот эксперимент был проведён в видео-бизнесе ZTE. Фронтальный бизнес включал 20 клиентов, воспроизводящих 30 минут видео сверхвысокой чёткости, и нормальное состояние заключалось в том, что система хранения обеспечивала равную и постоянную пропускную способность чтения данных для всех клиентов.
Рисунок 5(a) показывает случай, когда информация с жёстких дисков не собирается, Рис. 5(b) показывает случай, когда все жёсткие диски собираются одновременно традиционными методами, а Рис. 5(c) показывает случай метода поочередного сбора информации с жёстких дисков, представленного в этой статье. Вертикальная ось Рис. 5 представляет полосу пропускания воспроизведения клиента. Из результатов тестирования видно, что по сравнению с Рис. 5(a), хотя средняя полоса пропускания на Рис. 5(b) в целом снизилась только на 0.88%, система не могла обслуживать непрерывно в течение 9.18 секунд во время сбора SMART. Было значительное дрожание производительности в первые 11.21 секунд и последующие 4.23 секунды, и пользователи испытывали сильные задержки более 20 секунд при просмотре живого видео; По сравнению с Рис. 5(a), хотя средняя полоса пропускания на Рис. 5(c) в целом снизилась на 0.96%, в течение всего процесса не было сбоев системы, и пользователи не заметили никаких аномалий при воспроизведении видео. Из этого можно сделать вывод, что работа, представленная в этой статье, улучшила пользовательский опыт и снизила помехи для фронтального бизнеса.
Надёжность данных. Набор данных в этой статье является результатом сбора в реальном времени в реальной среде. Чтобы проверить надёжность набора данных, мы выполнили проверку целостности файла log_hdsmart_param.csv, в котором хранятся данные SMART в наборе данных. Для лучшего сравнения мы также провели проверки целостности данных SMART модели жёсткого диска ST4000DM000, выпущенных Backblaze в 2022 году. Результаты показаны в Таблицах 6, 7.
Проверка целостности
Проверка целостности Backblaze
Из таблицы видно, что пустые значения в этом наборе данных в основном сосредоточены в thresh, type, update, value, worst. Однако пустые значения составляют только 10.7% всех данных во всей колонке и 5.3% всех данных, что указывает на относительно небольшое количество пустых данных. И все упомянутые выше пустые значения встречаются на жёстких дисках типа SAS_HDD. Это связано со значительными различиями в базовых протоколах, целях проектирования и механизмах мониторинга между дисками SAS и жёсткими дисками SATA, что приводит к разным представлениям атрибутов SMART. Эти значения вызваны не потерей данных во время сбора или другими причинами, а скорее происходят из-за различных свойств типов жёстких дисков. Поэтому по сравнению с дисками SATA будут пробелы в thresh, type, update, value и worst. Мы рекомендуем обсуждать, является ли жёсткий диск неисправным, отдельно для различных типов жёстких дисков, поскольку их характерные свойства различаются.
В наборе данных Backblaze 911 132 360 пустых значений, что составляет 14.78% всех данных, что значительно выше, чем в наборе данных SMART-Z, предложенном в этой статье. Сравнивая данные в Таблицах 6, 7, можно более наглядно наблюдать, что набор данных, собранный в этой статье, обладает лучшей целостностью, что может доказать осуществимость технологии сбора.
Примечания по использованию
Набор данных SMART-Z, предложенный в этой статье, сохраняет информацию в формате файлов .csv и общедоступен в рамках открытого исходного кода (https://doi.org/10.17605/OSF.IO/24Y6G), что удобно для исследователей, чтобы загружать и обрабатывать наборы данных. Набор данных SMART-Z включает основную информацию обо всех жёстких дисках, атрибуты SMART жёстких дисков и основную информацию обо всех отключённых жёстких дисках. По сравнению с другими общедоступными наборами данных жёстких дисков, этот набор данных добавляет несколько атрибутов, таких как критические значения, наихудшие значения, IP-адрес устройства, бизнес-сценарии и время работы отключённых жёстких дисков. Кроме того, в результате наблюдений в этой статье было обнаружено, что когда SMART жёсткого диска впервые показывал аномальную производительность, медианное время до фактического отказа составляло 7 дней, а максимальное — 56 дней. Мы предлагаем исследователям следующие рекомендации:
(1) Вы можете обратить внимание на установку временных окон и фильтрацию признаков SMART. Разные модели и производители неисправных жёстких дисков могут испытывать аномалии на разных атрибутах SMART.
(2) В этой статье мы объявляем только все отключённые жёсткие диски. Существует много факторов, которые могут вызвать отключение жёсткого диска, и неисправность — лишь один из них. Это необходимо подробно обсуждать в сочетании с двумя другими файлами, log_hdsmart_base.csv и log_hdsmart_param.csv.
(3) В этой статье не содержится метки отказа жёсткого диска, поскольку настройки меток могут оказывать различное влияние на точность алгоритмов прогнозирования отказов жёстких дисков. Поэтому мы предоставляем только всю информацию об отключённых дисках. Вы можете устанавливать соответствующие метки на основе собственных потребностей и опыта. Вы можете пометить отказ за несколько дней заранее или можете установить отказ только на тот день.
(4) Информация о бизнес-сценарии включает информацию о физическом месте развёртывания жёсткого диска. Жёсткие диски в одном бизнес-сценарии могут подвергаться влиянию одних и тех же факторов окружающей среды, что также можно рассматривать как факторы для прогнозирования отказов жёстких дисков. Аналогично, IP-адреса также можно рассматривать.
(5) Файл offline_hdsmart.csv отображает совокупную продолжительность работы всех отключённых дисков. Длительная работа может вызывать высокую температуру жёсткого диска или постоянный износ магнитной головки. Поэтому также можно исследовать, будет ли продолжительность работы жёсткого диска оказывать определённое влияние на его срок службы.
(6) Этот набор данных аннотирует уровни предупреждения (Old_age/Pre_fail) атрибутов SMART для разных поставщиков. Вы можете присваивать разные веса разным уровням предупреждения атрибутов SMART, что предоставляет новое направление для прогнозирования отказов жёстких дисков.
Доступность кода
Код для сбора наборов данных прогнозирования отказов жёстких дисков может быть реализован в рамках открытой науки (https://doi.org/10.17605/OSF.IO/24Y6G). Сценарии оболочки могут быть запущены в среде Linux.
Источники
- AllenBruce. Monitoring hard disks with smart. Linux journal 2004 (2004).
- Friedman, J. H. Greedy Function Approximation: A Gradient Boosting Machine. The Annals of Statistics 29, 1189–1232 (2001).
- Li, J. et al. Hard drive failure prediction using Decision Trees. Reliability Engineering & System Safety 164, 55–65 (2017).
- Lu, S. et al. Making Disk Failure Predictions SMARter. File and Storage Technologies 151–167 (2020).
- Wei, S., Yang, H., Chen, Z. & Wang, P. SMART-2 (2017-2018) https://doi.org/10.17605/OSF.IO/2476G (2025).
- Ma, A. et al. RAIDShield. ACM Transactions on Storage 11, 1–28 (2015).