О себе Реферат Научные труды Индивидуальный раздел
Назад в библиотеку

Анализ методов машинного обучения для прогнозирования отказов жёстких дисков

Донецкий национальный технический университет

Источник: Клименко И.С. Анализ методов машинного обучения для прогнозирования отказов жёстких дисков / И.С. Клименко, О.Ю. Чередникова // Материалы научно-технической конференции «Донбасс будщего глазами молодых учёных - 2025»

Аннотация. В статье исследуется применение методов машинного обучения для прогнозирования отказов жёстких дисков на основе анализа S.M.A.R.T.-атрибутов. На массиве данных Backblaze производится обучение модели и сравнение эффективности алгоритмов Random Forest, XGBoost и логистической регрессии.

Ключевые слова: машинное обучение, дисковая память, накопитель, жёсткий диск, Random Forest, XGBoost, логистическая регрессия.

Abstract. The article explores the application of machine learning methods to predict hard disk failures based on the analysis of S.M.A.R.T. attributes. The model is trained on the Backblaze data array, the effectiveness of Random Forest, XGBoost and logistic regression algorithms is compared.

Keywords: machine learning, disk memory, storage, hard disk, Random Forest, XGBoost, logistic regression.

Введение

Дисковые накопители играют ключевую роль в сохранности данных в современных вычислительных системах. Внезапный отказ этих устройств может привести к необратимой потере важной информации. Для предотвращения вероятных последствий необходимо использовать мониторинговые системы. Существующие решения, такие как CrystalDiskInfo, основаны на анализе отдельных S.M.A.R.T.-атрибутов через заданные пороговые значения. Современным методом разработки подобной системы является внедрение машинного обучения [1]. Такой подход учитывает сложные взаимосвязи между многочисленными атрибутами диска, что позволяет выявить неочевидные при традиционном пороговом анализе паттерны.

Целью статьи является сравнительный анализ эффективности методов машинного обучения для автоматизированной диагностики состояния жёстких дисков на основе комплексного анализа S.M.A.R.T.-атрибутов.

Данные и методы

Для обучения модели использовались данные Backblaze – американской компании, предоставляющей услуги облачного хранения и резервного копирования данных и выставляющей в открытом доступе статистическую информацию о работе своих дисковых накопителей. В то же время весомой проблемой всех предоставленных датасетов является большой дисбаланс классов: случаи отказа составляют менее 1%. Для выхода из сложившейся ситуации был сбалансирован один из датасетов, что сократило количество записей с нескольких миллионов до нескольких тысяч, однако баланс классов перешёл в соотношение 50/50.

Для задачи бинарной классификации состояния HDD выбраны три алгоритма, представляющие различные подходы к машинному обучению: два типа ансамблевых методов: Random Forest, основанный на бэггинге, и XGBoost [2], реализующий градиентный бустинг, и базовый линейный метод логистической регрессии [3]. Для обеспечения репрезентативности выборки и валидности результатов данные перед обучением были разделены на обучающую и тестовую выборки в соотношении 80/20.

Данные и методы

Для оценки эффективности выбранных алгоритмов машинного обучения проведен сравнительный анализ по ряду метрик классификации. Результаты представлены на рисунке 1. По шкале Accuracy разрыв между лидером XGBoost и наихудшим показателем логистической регрессии составляет 21.4 процентных пункта. В метрике F1-Score, учитывающей баланс между точностью и полнотой, XGBoost и Random Forest демонстрируют близкие результаты, тогда как логистическая регрессия существенно отстает.

Сравнительная характеристика моделей
Рисунок 1 – Сравнительная характеристика моделей

Информация о соотношении между предсказанной и фактической классификации моделями дисков, сведённая в матрицу ошибок, представлена на рисунке 2. Random Forest допускает меньше ложных срабатываний (6 случаев против 9 у XGBoost), но пропускает больше реальных сбоев (25 против 19). XGBoost находит больше реальных отказов (193 против 187), но ценой незначительного увеличения ложных тревог.

Этот компромисс между точностью (precision) и полнотой (recall) является ключевым при выборе модели для практического внедрения. В сценариях, где стоимость ложного срабатывания высока (например, при планировании превентивных работ), предпочтение может быть отдано Random Forest. Если же критически важна максимальная сохранность данных и недопущение реальных отказов, более эффективным окажется XGBoost.

Матрица ошибок моделей
Рисунок 2 – Матрица ошибок моделей

На рисунке 3 изображены ROC-кривые. Ансамблевые методы продемонстрировали высокую дискриминативную способность. Логистическая регрессия показала приемлемое, но более низкое качество классификации.

ROC-кривые моделей
Рисунок 3 – ROC-кривые моделей

Заключение

В ходе исследования различных алгоритмов обучения моделей было установлено, что логистическая регрессия уступает ансамблевым методам по всем метрикам, что подтверждает нелинейный характер взаимосвязей между S.M.A.R.T.-атрибутами и состоянием накопителей. Анализ матриц ошибок выявил интересную особенность: Random Forest минимизирует ложные сигналы тревоги, тогда как XGBoost стремится к максимальному охвату реальных сбоев. Таким образом, XGBoost можно рекомендовать как модель с наилучшими предиктивными способностями в целом, в то время как выбор между ним и Random Forest должен определяться конкретными бизнес-требованиями и допустимым соотношением ложноположительных и ложноотрицательных срабатываний.

Основным ограничением исследования является ориентация исключительно на жёсткие диски. Современные системы хранения активно переходят на твердотельные накопители (SSD), которые содержат совершенно иные S.M.A.R.T.-атрибуты. В дальнейшем планируется провести аналогичное исследование для SSD дисков. Для этого необходимо будет самостоятельно проанализировать большое количество накопителей данного вида и сформировать соответствующие датасеты, так как на данный момент, по крайней мере в открытом доступе, их никто не предоставляет. Ещё одним направлением для будущих исследований является экспериментирование с другими методами борьбы с дисбалансом, такими как SMOTE (Synthetic Minority Over-sampling Technique), а также применение более сложных архитектур, например, нейронных сетей.

Практическая ценность работы заключается в том, что разработанная модель прогнозирования может быть интегрирована в системы мониторинга дата-центров, позволяя инженерам не просто реагировать на критические значения отдельных атрибутов, а получать агрегированную вероятностную оценку риска выхода из строя каждого диска в парке. Это открывает возможности для перехода от обслуживания по факту отказа к предиктивной стратегии, планируя замены накопителей в ходе плановых технических работ, что напрямую повышает отказоустойчивость и надежность всей системы хранения данных.

Список литературы

  1. Bruce Allen. 2004. Monitoring hard disks with smart. *Linux Journal* 2004, 117 (2004), 9.
  2. Nicolas Aussel, Samuel Jaulin, Guillaume Gandon, Yohan Peierlin, Erica Faoili, and Sophie Chabridon. 2017. Predictive Models of Hard Drive Failures Based on Operational Data. In *IEEE International Conference on Machine Learning and Applications (ICMLA '17)*. 619-625. https://doi.org/10.1109/ICMLA.2017.00-92
  3. Bahman Bahmani, Benjamin Moseley, Andrea Vattani, Ravi Kumar, and Sergei Vassilvitskii. 2012. Scalable k-means++. *Proc. VLDB Endow.* 5, 7, 622-633. https://doi.org/10.14778/2180912.2180915
  4. Anhui Bai, Mingjin Chen, Siyuan Peng, Guojun Han, and Zhijing Yang. 2022. Attention-Based Bidirectional LSTM With Differential Features For Disk RUL Prediction. In *International Conference on Electronic Information and Communication Technology (ICEICT '22)*. 684-689. https://doi.org/10.1109/ICEICT55736.2022.906829
  5. Sebastian Frischbier, Jawad Tahir, Christoph Doblander, Arne Hormann, Ruben Mayer, and Hans-Arno Jacobsen. 2022. Detecting trading trends in financial tick data: the DEBS 2022 grand challenge. In *Proceedings of the 16th ACM International Conference on Distributed and Event-Based Systems* (Copenhagen, Denmark) *(DEBS '22)*. ACM, New York, NY, USA, 132-138. https://doi.org/10.1145/3524860.3539645
  6. Qinda Hai, Shuangwang Zhang, Chang Liu, and Guojun Han. 2022. Hard Disk Drive Failure Prediction Based on GRI Neural Network. In *IEEE/CIC International Conference on Communications in China (ICCC '22)*. 696-701. https://doi.org/10.1109/ICCC5548.2022.9880716
  7. Bianca Schroeder and Garth A. Gibson. 2007. Disk failures in the real world: what does an MTTF of 1,000,000 hours mean to you?. In *Proceedings of the 5th USENIX Conference on File and Storage Technologies* (San Jose, CA) *(FAST '07)*. USENIX Association, USA, 1-es.
  8. Jawad Tahir, Christoph Doblander, Ruben Mayer, Sebastian Frischbier, and Hans-Arno Jacobsen. 2021. The DEBS 2021 grand challenge: analyzing environmental impact of worldwide lockdowns. In *Proceedings of the 15th ACM International Conference on Distributed and Event-Based Systems* (Virtual Event, Italy) *(DEBS '21)*. ACM, New York, NY, USA, 136-141. https://doi.org/10.1145/3465480.346536
  9. Laurens van der Maaten and Geoffrey Hinton. 2008. Visualizing Data using t-SNE. *Journal of Machine Learning Research* 9, 86 (2008), 2579-2605. http://jmlr.org/papers/v9/vandermaaten08a.html
  10. Yang Zhou, Fang Wang, and Dan Feng. 2022. A Disk Failure Prediction Method Based on Active Semi-supervised Learning. *ACM Trans. Storage* 18, 4, Article 35 (nov 2022), 33 pages. https://doi.org/10.1145/3523699