Прогнозирование отказов жестких дисков на основе смешанного ансамблевого обучения
Миньюй Чжан, Вэньцян Гэ, Жуйчунь Тан, Пэйшунь Лю
Колледж информационных наук и технологий, Океанический университет Китая, Циндао 266100, Китай
Аннотация: Как наиболее широко используемое сегодня запоминающее устройство, жесткие диски эффективны и удобны, но ущерб от их отказа может быть очень значительным. Поэтому предупреждения об отказе жесткого диска заранее, позволяющие заранее выполнить резервное копирование и перенос хранимого содержимого, могут уменьшить множество потерь. В последние годы появился непрерывный поток исследований по прогнозированию отказов жестких дисков. Точность обнаружения различных методов, от базовых моделей машинного обучения, таких как деревья решений и случайные леса, до методов глубокого обучения, таких как нейронные сети с обратным распространением (BP) и рекуррентные нейронные сети, также постоянно улучшается. В этой статье на основе идеи смешанного ансамблевого обучения предлагается новый метод прогнозирования отказов, комбинирующий алгоритмы машинного обучения и нейронные сети, на общедоступных наборах данных жестких дисков BackBlaze. Эксперимент по прогнозированию отказов проводится только с использованием данных S.M.A.R.T., то есть характеристик, собранных технологией самоконтроля, анализа и отчетности, которые подсчитываются внутри жесткого диска во время его работы. Результаты экспериментов показывают, что данная модель ансамблевого обучения способна превзойти другие независимые модели по критерию оценки, основанному на коэффициенте корреляции Мэттьюса. Кроме того, по результатам экспериментов на нескольких типах жестких дисков найдена модель ансамблевого обучения с высокой производительностью для большинства типов дисков, что решает проблему низкой устойчивости и обобщающей способности традиционных методов машинного обучения и доказывает эффективность и высокую универсальность данного метода.
Ключевые слова: жесткий диск; прогнозирование отказов; S.M.A.R.T.; ансамблевое обучение
1 Введение
1.1. Предпосылки
Жесткие диски являются основным и наиболее важным запоминающим устройством, используемым в современных компьютерах, и многие центры обработки данных полагаются на большое количество жестких дисков для хранения жизненно важной информации. С быстрым развитием Интернета и облачных платформ хранение и обработка массивных данных создают серьезные проблемы для соответствующего персонала и систем хранения [1]. Небольшой отказ жесткого диска приведет к значительной потере данных, что, в свою очередь, вызовет экономические потери. Для снижения такого риска в 1990-х годах была разработана технология S.M.A.R.T. (технология самоконтроля, анализа и отчетности). Под руководством Compaq и в сотрудничестве с несколькими производителями жестких дисков эта новая технология отслеживает различную рабочую информацию внутри диска, такую как количество операций чтения/записи, количество загрузок/разгрузок головок, частота ошибок позиционирования и текущая температура окружающей среды, и записывает ее в специальные регистры через двоичный код. Эти значения атрибутов обычно обновляются один раз в день. На основе этих значений пользователи могут сравнивать их с пороговыми значениями, установленными различными производителями, чтобы заранее принять меры для устранения сбоя. Некоторые жесткие диски могут даже самостоятельно подавать сигнал тревоги, чтобы напомнить пользователям о необходимости резервного копирования данных для уменьшения потерь. В идеальном состоянии, пока некоторые значения атрибутов жесткого диска не превышают пороговых значений и находятся в разумных пределах, с диском не должно возникать проблем [2].
Существует множество причин выхода жесткого диска из строя. Отказ может быть вызван внутренними причинами, такими как повреждение компонентов из-за чрезмерно длительного срока службы или отказ сектора, вызванный случайностью, в то время как косвенные и прямые воздействия на жесткие диски вызываются внешними причинами, такими как вибрации, пыль, статическое электричество, магнитные поля и нестабильное напряжение. Таким образом, существует множество факторов, способных изменять значения атрибутов S.M.A.R.T. Однако, показатель обнаружения, достигаемый путем чтения диапазона изменений и пределов конкретных значений атрибутов, включая изменяющиеся значения S.M.A.R.T. и пороги, установленные производителем, что может позволить избежать определенных потерь, очень низок и составляет всего около 10%.
Поэтому исследователи использовали технологии в области вычислительной техники, которые постепенно созрели, для прогнозирования отказов жестких дисков и достигли хороших результатов.
1.2. Связанные работы
Хьюз и др. [3] улучшили алгоритм статистической проверки гипотез без распределения, который заменил алгоритм предупреждения о максимальной ошибке, и предложили два новых метода на основе этого математико-статистического подхода, а именно ранговый критерий для одного атрибута (ORing single-attribute rank-sum test) и многомерный ранговый критерий (multivariate rank-sum test). Эти авторы также провели эксперименты на основе характеристик S.M.A.R.T. и получили точность предупреждения об отказах около 40–60% и уровень ложных срабатываний около 0,2–0,5%. Ван Юй и др. [4] предложили метод динамического отслеживания для прогнозирования отказов жестких дисков на основе модели случайного процесса с переключаемыми состояниями. Фильтр частиц Рао-Блэквелла использовался для обновления оценок и параметров модели, и был разработан динамический порог отказа. Однако общая структура была сложной, а универсальность невысокой. По сравнению с математико-статистическими методами, технология машинного обучения, которая в последние годы поднималась и развивалась, как раз отвечала потребностям людей, и различные методы могли давать хорошие результаты. Ян Цибо и др. [5] исследовали четыре метода выбора признаков и восемь методов машинного обучения для обнаружения аномалий. Путем перестановок и комбинаций они провели эксперименты на двух наборах данных и получили комбинацию методов выбора признаков и методов обнаружения аномалий, которая в то время давала наилучший эффект, предоставив хорошую идею и направление для последующих исследователей. Викас Томер и др. экспериментировали с алгоритмами наивного Байеса, дерева решений и случайного леса и использовали точность, прецизионность, AUC и время выполнения в качестве критериев, показав, что алгоритм случайного леса имеет наилучшую производительность.
Кроме того, с появлением и развитием глубокого обучения, нейронные сети привлекли внимание людей. Различные нейронные сети, способные выполнять сложные операции и обрабатывать данные временных рядов, могут прогнозировать отказы жестких дисков более точно и эффективно. Ху Лихань и др. [1] использовали сеть LSTM для обработки данных временных рядов и получили лучшие результаты, чем методы машинного обучения. Однако модель может стареть при длительном использовании, и структуру модели необходимо дополнительно улучшать. Основываясь на работе, проделанной Ху Лихань, Кахьяди и др. [6] улучшили предыдущую структуру сети и сосредоточили свою работу на решении проблемы дисбаланса данных. Они использовали метод частичного недодискретизации (undersampling) для получения лучших результатов, но оптимизация модели была недостаточной, и не было рассмотрено использование лучших методов выборки. После распространения двунаправленных сетей LSTM, Остин Курси [2] предложил новый метод стандартизации данных. Новая модель использовалась для экспериментов. В отличие от предыдущих методов, выполнявших задачи классификации, она использовалась для прогнозирования оставшегося срока службы жестких дисков, и аппроксимация кривой была очень хорошей. Алессио Буррелло и др. [7] представили новую сверточную сеть, известную как TCN (временная сверточная сеть), для анализа временных рядов и использовали SMOTE (метод передискретизации синтетического меньшинства) для решения проблемы дисбаланса данных. Ло Чуань и др. [8] использовали не только характеристики самого жесткого диска, но также учитывали влияние соседних дисков и предложили новый метод выборки, TPS (временная прогрессивная выборка), чтобы смягчить влияние дисбаланса данных. Лу Сиди [9] взял S.M.A.R.T. в качестве обучающих признаков и добавил данные о производительности жестких дисков и серверов, а также влияние реального пространственного расположения диска. Эти авторы использовали новую нейронную сеть, известную как CNN-LSTM, для экспериментов. Итоговые результаты показали, что экспериментальные результаты с учетом всех трех показателей являются наилучшими.
Производительность связанных работ
Таблица 1 показывает методы, использованные предыдущими исследователями, и полученные результаты. Согласно моделям и методам, использованным предшественниками, мы замечаем, что все вышеупомянутые методы прогнозирования отказов жестких дисков представляют собой простые методы машинного или глубокого обучения, которые, как правило, имеют недостатки длительного времени выполнения и требуют большого количества обучающих данных. Последние статьи были сосредоточены только на использовании новых технологий, при этом устойчивость и универсальность любой отдельной используемой модели имеют определенные ограничения [10,11]. Поэтому мы полагаем, что можно использовать идею ансамблевого обучения для объединения методов машинного обучения с глубокими нейронными сетями, чтобы получить лучшие результаты за более короткое время обучения и создать модели с лучшей универсальностью.
На основе метода смешанного ансамблевого обучения (blending ensemble learning) в данной статье предлагается метод прогнозирования отказов жестких дисков, сочетающий алгоритмы машинного обучения и глубокие нейронные сети, и проводятся эксперименты на общедоступных наборах данных, собранных BackBlaze. В итоге, в качестве критерия оценки используется коэффициент корреляции Мэттьюса, значение которого, полученное нашим методом, выше, чем при использовании отдельной модели, а время обучения модели значительно сокращается, что доказывает эффективность данного метода. Кроме того, мы зафиксировали наборы данных определенной модели жесткого диска в качестве обучающей выборки для тестирования шести различных моделей жестких дисков от одного и того же или разных производителей. Согласно результатам эксперимента, была построена модель ансамблевого обучения, которая может давать хорошие результаты на всех наборах данных, обладающая высокой универсальностью и устойчивостью.
Остальная часть статьи организована следующим образом: в разделе 2 кратко излагаются предпосылки ансамблевого обучения и история его развития. Методологическая структура и подметоды, используемые в данной статье, описаны и представлены в разделе 3. Раздел 4 знакомит с набором данных, используемым в статье, и методом предварительной обработки, а также сравнивает результаты экспериментов. Последний раздел — заключение, в котором резюмируется полный текст, указываются недостатки и дается прогноз на будущую работу.
2 Ансамблевое обучение
Ансамблевое обучение, являющееся важной ветвью машинного обучения, появилось еще в 1988 году [12]. Его основная идея заключается в использовании N слабых учеников (weak learners) со слабым эффектом обучения в качестве базовых учеников (base learners), интеграции их результатов в соответствии с различными правилами и рассмотрении целого как сильного ученика (strong learner), чтобы сделать окончательные результаты более точными.
Bagging и boosting — это часто используемые стратегии ансамблевого обучения. Первый был предложен Лео Брейманом из Беркли еще в 1996 году [13]. Стратегия возмущения обучающих выборок включает обучение нескольких разных базовых учеников параллельно при условии множественных случайных выборок с возвращением, затем, наконец, взятие большинства голосов или среднего значения всех результатов для получения окончательного результата в соответствии с фактической ситуацией. Позже, в 1998 году, Тин Кэм Хо [14] предложил метод случайных подпространств (RSM), который использует стратегию возмущения входных атрибутов для обучения базового классификатора путем случайного выбора некоторых признаков вместо всех признаков в каждом обучении и получает окончательный результат путем взятия среднего значения или большинства голосов результатов каждого базового классификатора. Комбинируя два вышеупомянутых подхода случайного возмущения, Лео Брейман [15] предложил алгоритм случайного леса в 2001 году, который до сих пор используется как представительный алгоритм стратегии bagging. Соответственно, метод boosting, предложенный Робертом Э. Шапиром в 1990 году [16], также следует той же стратегии возмущения обучающих выборок. Основная идея заключается в увеличении веса ошибочно классифицированных образцов после каждого обучения базового ученика для обучения следующего базового ученика до тех пор, пока не будет получен сильный ученик с хорошими результатами. Поскольку базовые ученики должны обучаться последовательно, между ними существует сильная зависимость. В качестве примера возьмем представительный алгоритм AdaBoost, его окончательный результат может быть взвешенным голосованием каждого базового ученика. Другими алгоритмами являются GBDT и его улучшенные версии, такие как XGBoost и LightGBM. Помимо этого, существуют стратегии, такие как возмущение параметров алгоритма, возмущение выходных меток или смешивание различных методов возмущения для обучения разных базовых классификаторов. Несколько из этих представительных алгоритмов будут представлены в разделе 3.
В дополнение к двум описанным выше распространенным стратегиям ансамблевого обучения, существуют две расширенные стратегии: это стекинг (stacking) [17] и блендинг (blending), технология, используемая в данной статье. Принципы двух стратегий ансамблевого обучения в основном одинаковы. Стекинг делится на два слоя; на первом слое используется k-кратная перекрестная проверка обучающих наборов с использованием M базовых учеников для получения k результатов на проверочных наборах и k результатов на тестовых наборах. Затем k результатов группируются и объединяются для получения новых обучающих и тестовых наборов [18]. Полученный новый обучающий набор и тестовый набор отбрасывают исходные признаки данных и заменяют их новыми признаками из M столбцов, то есть результатами прогнозирования на M базовых учениках. Наконец, новый набор данных обучается и тестируется на втором слое с использованием другого ученика для получения окончательных результатов. Метод блендинга отказался от k-кратной перекрестной проверки на основе стекинга, что может упростить алгоритмический процесс и значительно сократить время выполнения, в то время как эффекты обучения существенно не отличаются. Поэтому в данной статье был выбран метод смешанного ансамблевого обучения (blending ensemble learning) в качестве основы для построения экспериментальной структуры.
Алгоритм 1 представляет псевдокод процесса построения модели смешанного ансамблевого обучения.
3 Материалы и методы
В этом разделе описываются алгоритмы, используемые для каждого компонента модели ансамблевого обучения, применяемой в данном эксперименте. Поскольку в данной статье фактически решается задача бинарной классификации, при представлении каждого алгоритма мы сосредоточимся на описании принципов и характеристик каждого алгоритма в задачах классификации.
3.1. Слабые ученики (Week Learners)
3.1.1. Логистическая регрессия
Логистическая регрессия — это алгоритм машинного обучения, часто используемый для классификации. Подобно линейной регрессии, разница заключается в функции, используемой для аппроксимации данных. Линейная регрессия используется для вычисления линейной функции для аппроксимации данных в соответствии с характеристиками изученных данных, чтобы предсказать новую точку. Наоборот, логистическая регрессия использует сигмоидную функцию для аппроксимации данных, что более эффективно, чем линейная функция. Поскольку диапазон значений сигмоидной функции равен \((0,\,1)\), в задаче бинарной классификации значение сигмоидной функции в точке можно рассматривать как вероятность отнесения к положительному образцу, а затем прогнозируемый результат в этой точке можно определить путем сравнения с установленным порогом.
Форма аппроксимирующей функции множественной линейной регрессии: \(y=\omega_{0}x_{0}+\omega_{1}x_{1}+\cdots+\omega_{n}x_{n}\) или \(y=W^{T}X\), а аппроксимирующая функция логистической регрессии, которая равна \(g(z)=\left(\frac{1}{1+e^{W^{T}X}}\right)\), может быть получена путем подстановки в сигмоидную функцию. В этот момент получается вероятность того, что точка прогнозируется как положительный образец, и можно далее получить вероятность успешного прогноза в определенной точке:
\[P(true)=(g(\omega,x_{i}))^{y^{i}}*(1-g(\omega,x_{i}))^{1-y^{i}}\]
где \(y^{i}\) относится к прогнозируемому значению образца, которое в задаче бинарной классификации равно либо 0, либо 1.
Получив вероятность успешного прогноза для образца, можно попытаться максимизировать частоту успешных прогнозов для всех образцов, то есть максимизировать произведение вероятностей успешного прогноза для всех точек. Используя метод максимального правдоподобия для решения этой задачи, пусть \(h_{\theta}(x)=\frac{1}{1+e^{-x}}\). Тогда функция максимального правдоподобия выражается следующим образом:
\[L(\theta)=\prod_{i=1}^{m}(h_{\theta}(x^{(i)}))^{y^{(i)}}(1-h_{\theta}(x^{(i)}))^{1-y^{(i)}}\]
Берем логарифм и отрицательный знак с обеих сторон одновременно, чтобы получить:
\[J_{log}(\omega)=\sum_{i=1}^{m}-y_{i}\log(p(x_{i};\omega))-(1-y_{i})\log(1-p(x_{i};\omega))\]
Следовательно, наша цель — минимизировать уравнение (3), которое является функцией потерь для логистической регрессии, также известной как функция перекрестной энтропии. Затем для решения минимума и \(\omega\) используется метод градиентного спуска.
3.1.2. Метод k-ближайших соседей
По сравнению с логистической регрессией, алгоритм k-ближайших соседей (KNN) намного проще. Его основная идея заключается в вычислении расстояния между другими точками вблизи выбранной точки, выборе k точек с наименьшим расстоянием, статистике по типам классификации этих k точек и выборе класса с наибольшей частотой в качестве классификации для выбранных точек. Вычисляемые здесь расстояния — это в основном евклидово расстояние и расстояние Манхэттена, из которых евклидово расстояние используется более широко.
\[\textit{Евклидово расстояние}:d(x,y)=\sqrt{\sum_{k=1}^{n}(x_{k}-y_{k})^{2}}\]
\[\textit{Расстояние Манхэттена}:d(x,y)=\sqrt{\sum_{k=1}^{n}|x_{k}-y_{k}|}\]
Эти два уравнения приведены для примера n-мерного пространства, где \(x_{k}\) и \(y_{k}\) — это значения \(k\)-го измерения для двух точек соответственно.
3.1.3. Метод опорных векторов
Основное внимание в классификаторе SVM уделяется нахождению гиперплоскости, которая может разделить два класса образцов. Для образцов с двумерными векторами признаков гиперплоскость является линией. Для наборов образцов с 3D векторами признаков гиперплоскость является поверхностью. Следовательно, размерность гиперплоскости всегда на 1 меньше размерности вектора признаков. Как показано на рисунке 1, зазор (margin) относится к сумме перпендикулярных расстояний от точек выборки разных классов по обе стороны от гиперплоскости до гиперплоскости. Процесс поиска желаемой гиперплоскости — это процесс поиска максимального зазора. Необходимость максимизировать зазор объясняется повышением устойчивости и минимизацией частоты ошибок классификации. Две точки выборки, которые определяют максимальный зазор, называются опорными векторами, что также является происхождением названия метода опорных векторов (support-vector machine).
3.1.4. Наивный байесовский классификатор
Наивный байесовский классификатор — это классификатор, который использует теорему Байеса для решения вероятности, чтобы достичь цели классификации. «Наивный» означает, что все признаки считаются независимыми друг от друга.
Согласно правилу Байеса, уравнение можно рассматривать как:
\[p(classes|features)=\frac{p(features|classes)p(classes)}{p(features)}\]
Кроме того, согласно теореме о полной вероятности, знаменатель в правой части может быть вычислен по следующему уравнению:
\[P(B)=\sum_{i=1}^{n}P(A_{i})P(B|A_{i})\]
Наконец, вычисляется вероятность принадлежности к определенной категории, и берется максимальное значение в качестве результата классификации.
Существуют три различные формы наивных байесовских классификаторов, различающиеся в зависимости от того, является ли вектор признаков непрерывным или дискретным. Классификация Бернулли применима в условии, когда векторы признаков соответствуют распределению Бернулли, то есть бинарному распределению. Полиномиальная наивная байесовская классификация подходит для дискретных векторов признаков и соответствует полиномиальным распределениям. Последний метод классификации, гауссовская наивная байесовская классификация, используется, когда векторы признаков являются непрерывными переменными и соответствуют или приближаются к нормальному распределению. Признаки S.M.A.R.T., используемые в этой статье, являются непрерывными переменными, поэтому для эксперимента используется гауссовский наивный байесовский классификатор.
3.2. Сильные ученики (Strong Learners)
3.2.1. Случайный лес
Случайный лес — это представительный алгоритм ансамблевого обучения, принадлежащий к семейству стратегий bagging. Как следует из названия, он использует деревья решений в качестве базового ученика и строит несколько (обычно сотни) деревьев решений с использованием метода выборки с возвращением. При классификации тестовые образцы будут получать результаты на всех построенных деревьях решений и определять категорию тестовых образцов с помощью стратегии «голосования», то есть взятия моды. Каждый раз при запуске алгоритма случайного леса случайным образом выбираются разные образцы для построения разных деревьев решений, и в процессе построения дерева решений выбор признаков и признаки разделения узлов являются случайными. Такая высокая случайность позволяет избежать переобучения и повысить производительность алгоритма.
3.2.2. GBDT
GBDT (дерево с градиентным бустингом) — один из представительных алгоритмов ансамблевого обучения, принадлежащих к семейству стратегий boosting [19]. Он также использует дерево решений в качестве базового ученика и использует метод последовательной работы, отличный от стратегии bagging (базовые ученики работают параллельно), для выполнения улучшений и обновлений модели в ходе непрерывных итераций. GBDT обращает внимание на остаток, генерируемый в процессе обучения, то есть разрыв между результатами обучения между двумя слоями. В процессе последовательной работы нескольких деревьев решений функция ошибок, построенная градиентом, постепенно оптимизируется, чтобы вся модель достигла более высокого уровня прогнозирования.
3.2.3. XGBoost
XGBoost (экстремальный градиентный бустинг) — это улучшенная версия, основанная на GBDT, с той же основной идеей алгоритма, что и у GBDT. В отличие от функции потерь разложения Тейлора первого порядка, используемой GBDT, XGBoost использует разложение Тейлора второго порядка, что, с одной стороны, повышает точность функции потерь, а с другой стороны, помогает настраивать больше функций потерь, делая их более легкими для аппроксимации. Кроме того, XGBoost также вводит регуляризационный член в целевую функцию, чтобы избежать переобучения. По сравнению с базовым учеником GBDT, который может использовать только CART (дерево классификации и регрессии), XGBoost также может использовать линейный классификатор в качестве базового ученика, что является более гибким.
XGBoost также выполняет операции предварительной сортировки признаков. Признаки предварительно сортируются и сохраняются в специальном кэше, так что требуемые признаки могут быть извлечены непосредственно из кэша и рассчитаны при построении структуры дерева. Это позволяет выполнять вычисления параллельно, а также увеличивает сложность по пространству. В целом, XGBoost — это инженерная реализация GBDT, которая представляет собой относительно завершенный метод, основанный на оригинальном алгоритме со многими оптимизациями.
3.2.4. AdaBoost
AdaBoost (адаптивный бустинг) был предложен в 1997 году и является первым предложенным алгоритмом ансамблевого обучения, использующим стратегию boosting [20]. Основная идея заключается в увеличении веса ошибочно классифицированного образца и соответствующем уменьшении веса правильно классифицированного образца в ходе каждой последовательной итерации. Такой итеративный метод может заставить модель больше обращать внимание на образцы, которые были неправильно классифицированы при обучении, и может лучше снижать ошибку и повышать производительность модели.
Вообще говоря, AdaBoost также использует модель дерева решений в качестве базового ученика для обучения. Эта стратегия обучения может значительно повысить уровень и эффективность обучения базового ученика, не вызывая переобучения. Однако недостатком этого метода является то, что он будет чрезмерно усиливать важность некоторых аномальных точек или шума, поэтому он сильно подвержен влиянию шума.
3.3. Нейронная сеть с обратным распространением (BP)
Метод нейронной сети с обратным распространением (BP) — это оптимизированная версия метода MLP (многослойный перцептрон), созданная путем добавления шага обратного распространения для обновления параметров при условии MLP.
Как показано на рисунке 2, нейронные сети BP делятся на три слоя: входной слой, скрытый слой и выходной слой, причем несколько скрытых слоев можно размещать последовательно. Вес и смещение начальной ячейки могут генерироваться случайным начальным числом. Входные признаки сначала распространяются вперед через линейное преобразование скрытого слоя и активируются функциями активации tanh и sigmoid. Затем вычисляется ошибка между выходным результатом и реальным значением (например, MSE), и для обновления весов и смещения используется градиентный спуск для завершения одного обратного распространения. После n итераций процесса прямого и обратного распространения ошибка может быть уменьшена до очень маленького значения, и окончательные параметры смогут хорошо прогнозировать результаты.
3.4. LSTM
LSTM (долгая краткосрочная память) — это вариант RNN (рекуррентной нейронной сети), созданный после решения проблемы взрыва и исчезновения градиента. LSTM был впервые предложен в 1997 году [21] и не был широко использован и далее улучшен до XXI века, когда машинное обучение быстро развивалось.
Хотя за последнее десятилетие было предложено много современных нейронных сетей, таких как Transformer и его многочисленные вариации, LSTM по-прежнему пользуется популярностью у многих благодаря превосходной способности к обучению и относительно менее сложной структуре. До сих пор LSTM остается основным выбором для обработки данных временных рядов. По сравнению с RNN, LSTM вводит структуру множества затворных (управляющих) блоков, таких как забывающий затвор (forget gate), входной затвор (input gate) и выходной затвор (output gate), для обработки данных временных рядов [22, 23].
Структура ячейки LSTM показана на рисунке 3. В отличие от RNN, которая имеет только одно передаваемое состояние за цикл, LSTM добавляет концепцию состояния ячейки (cell state), которая может хранить полезную информацию предыдущих обучающих данных в течение длительного времени, в то время как скрытое состояние (hidden state) больше уделяет внимания недавней информации. Следовательно, каждая ячейка LSTM имеет три входа, включая данные в текущий момент времени, состояние ячейки и скрытое состояние в предыдущий момент времени, и два выхода, а именно состояние ячейки и скрытое состояние в текущий момент времени. Именно благодаря этим характерным затворным блокам LSTM способен обрабатывать данные с большим временным промежутком, отсеивать полезную информацию и отбрасывать бесполезную информацию, чтобы занимать небольшой объем ресурсов и обрабатывать большое количество данных.
Входы на рисунке 3 одинаковы; то есть они представляют собой комбинацию скрытого состояния предыдущего момента времени, входного значения этого момента времени (например, если данные имеют матричную форму, они объединяются) и состояния ячейки в предыдущий момент времени. Самый левый блок, называемый забывающим затвором, предназначен для выбора информации, которую следует забыть, или информации, которая не очень полезна для обучения. Его расчетное уравнение следующее:
\[f_{i}=\sigma(W_{f}\cdot[h_{i-1},x_{i}]+b_{f})\]
где \(\sigma\) — сигмоидная функция активации, которая отображает значение в диапазон \((0,1)\). \(W_{f}\) и \(b_{f}\) задают вес и смещение для забывающего затвора соответственно.
Слева от забывающего затвора находится входной затвор. В противоположность забывающему затвору, роль этого затворного блока заключается в вычислении информации, которую следует сохранить. Расчетное уравнение следующее:
\[i_{t}=\sigma(W_{i}\cdot[h_{i-1},x_{i}]+b_{i})\]
\[C^{\prime}_{t}=tanh(W_{C}\cdot[h_{i-1},x_{i}]+b_{C})\]
где \(i_{t}\) может управлять тем, какая информация сохраняется, в то время как \(C^{\prime}_{t}\) использует функцию активации tanh для вычисления входной информации в этот момент времени.
После расчета трех вышеуказанных уравнений состояние ячейки может быть обновлено. Расчетное уравнение следующее:
\[C_{t}=f_{i}*C_{t-1}+i_{t}*C^{\prime}_{t}\]
Смысл этого уравнения заключается в том, что обновление состояния ячейки этого момента времени делится на два шага. Первый шаг — умножение (поточечное умножение) результата, полученного забывающим затвором, на состояние ячейки предыдущего момента времени, чтобы отфильтровать предыдущую бесполезную информацию. Второй шаг — умножение двух выходных результатов входного затвора для получения информации, которая должна быть учтена в этот момент времени. Результаты этих двух шагов затем складываются вместе, чтобы достичь цели забыть старую бесполезную информацию и добавить новую информацию.
Обновленное состояние ячейки является первым выходным значением LSTM, а вторым выходным значением является скрытое состояние \(h_{t}\) этого момента времени. Расчетное уравнение также включает две части:
\[o_{t}=\sigma(W_{o}\cdot[h_{i-1},x_{i}]+b_{o})\]
\[h_{t}=o_{t}*tanh(C_{t})\]
В этом случае \(h_{t}\) является вторым выходом ячейки, содержащим полезную информацию предыдущего момента времени после фильтрации и информацию текущего момента.
3.5. Методологическая структура
Экспериментальная структура, разработанная на основе вышеупомянутых классификаторов и метода смешанного ансамблевого обучения, показана на рисунке 4.
В этой статье с использованием структуры, показанной на рисунке 4, и описанных выше алгоритмов классификации построены два класса структур моделей смешанного ансамблевого обучения. Первый использует случайный лес, GBDT, XGBoost и AdaBoost в качестве первого слоя базовых учеников, а второй метод использует логистическую регрессию, k-ближайших соседей, метод опорных векторов и гауссовский наивный байесовский классификатор в качестве первого слоя базовых учеников. Затем их прогнозные результаты используются в качестве новых признаков для построения новых обучающих и тестовых наборов. Затем нейронная сеть BP используется в качестве ученика второго слоя для обучения и тестирования новых наборов данных, и получаются окончательные результаты, которые сравниваются с экспериментальными результатами с использованием традиционных методов. Причина, по которой базовые ученики делятся на две категории, заключается в том, что первый тип базового ученика является высокоэффективным и может достигать высокого уровня классификации, в то время как второй тип базовых учеников является относительно слабым классификатором. Две группы базовых учеников с большим разрывом в производительности классификации используются для наших экспериментов, что может лучше подчеркнуть эффективность метода смешанного ансамблевого обучения.
Кроме того, наблюдая за промежуточными результатами экспериментов, мы также заменяем базовых учеников, оказывающих наименьшее влияние на результат ансамблевой модели в двух группах, сетью LSTM, чтобы дополнительно проверить эффективность метода смешанного обучения и одновременно найти лучшую производительность модели. Среди них производительность XGBoost очень похожа на производительность GBDT. В этом эксперименте разница в эффекте между двумя алгоритмами невелика, поэтому XGBoost был заменен. В другой группе результаты гауссовского наивного байесовского классификатора были настолько нестабильны, что мы решили заменить его, чтобы сравнить экспериментальные результаты.
4 Эксперимент
4.1. Набор данных
Набор данных, используемый в эксперименте, поступает из общедоступного набора данных по жестким дискам на официальном сайте BackBlaze. BackBlaze составляет и рассматривает данные жестких дисков с 2013 года, публикуя квартальную и годовую статистику по использованию жестких дисков различных производителей и сравнивая их с предыдущими годами, чтобы сделать выводы. Они также сделали исходный набор данных по жестким дискам доступным для просмотра и исследований.
Элементы данных, включенные в набор данных BackBlaze по жестким дискам, показаны в таблице 2. Среди них дата, серийный номер, модель, емкость и факт отказа жесткого диска всегда присутствуют и имеют одинаковое значение для всех жестких дисков, в то время как следующие наборы признаков S.M.A.R.T. различаются в зависимости от модели жесткого диска. Поскольку разные производители жестких дисков имеют разные определения и акценты для собственных признаков S.M.A.R.T., нормально, что одни и те же признаки S.M.A.R.T. имеют разное значение для жестких дисков разных производителей. Поэтому при условии, что количество вышедших из строя образцов не должно быть слишком маленьким, а уровень отказов дисков должен быть в нормальном диапазоне, в этом эксперименте выбирается жесткий диск ST4000DM000 компании Seagate за более чем шесть лет с 2016 по 2022 год в качестве объекта эксперимента. Статистические данные за некоторые годы показаны в таблице 3.
Поскольку 2022 год еще не закончился, в 2022 году были собраны только данные за первые два квартала, а именно с января по июнь, с общим количеством 268 неисправных образцов, и годовой уровень отказов еще неизвестен.
Как видно из статистики, годовой уровень отказов данных диска ST4000DM000 за эти шесть лет в основном составляет около 2%. Согласно статистике, годовой уровень отказов жестких дисков в нормальных условиях должен составлять от 0,5% до 2%. Поэтому причина выбора этой модели жесткого диска заключается в том, что уровень отказов всегда остается на высоком уровне, неисправные образцы более многочисленны, и количество данных соответствует нашим требованиям.
Выбранная часть набора данных BackBlaze о жёстких дисках
Статистика жёсткого диска ST4000DM000
4.2. Предварительная обработка данных
Поскольку слишком много исправных образцов не может сыграть значительной роли в прогнозировании отказов, экспериментальные данные, выбранные в этом эксперименте, — это все вышедшие из строя образцы и образцы за 14 дней до аномалии, поэтому соотношение исправных образцов к неисправным составляет 14:1.
4.2.1. Выбор признаков
Поскольку каждый признак S.M.A.R.T. в наборе данных делится на исходные значения (raw values) и нормализованные значения (normalized values), и мы не знаем стандарты каждого производителя жестких дисков для нормализации признаков, мы отбрасываем нормализованные значения, сохраняем исходные значения и нормализуем по собственному стандарту.
После того, как данные модели диска ST4000DM000 были отфильтрованы, сначала были удалены все нормализованные значения и столбцы признаков, представленные как полностью пустые (потому что статистика всех моделей жестких дисков собиралась вместе, были признаки, принадлежащие одной модели жесткого диска, но не принадлежащие другой модели, которые для последней были полностью пустыми). Далее мы стандартизировали данные блоками (подробно в разделе 4.2.2) и удалили все нулевые столбцы после стандартизации. Поскольку данные собирались поквартально, после отдельной обработки данных бралось пересечение признаков четырех кварталов, поэтому осталось 15 признаков. На основе критерия отказа или не отказа (фактически эти два вида графиков имеют одинаковый смысл) были построены диаграммы скрипки (violin plots) и диаграммы размаха (box plots) этих 15 признаков и выбрано 10 признаков, которые были более различимыми. Наконец, чтобы предотвратить избыточность признаков, была построена тепловая карта (heat map) этих 10 признаков. Из групп признаков с сильной корреляцией среди этих признаков был выбран один или несколько признаков, и в итоге в эксперименте было использовано пять признаков.
По сути, каждый признак разных типов данных численно различается в соответствии с категорией диаграммы скрипки и диаграммы размаха, и отмечаются граничные данные, такие как медиана и два квартиля каждого признака для каждого типа данных. Благодаря визуализации этих данных можно легко обнаружить численные различия между образцами разных категорий. Разница между двумя графиками заключается в том, что диаграмма скрипки может отражать распределение численных количеств. Диаграмма размаха может лучше различать квартили. Как показано на рисунке 5, все признаки сгруппированы между 0 и 1, потому что они были нормализованы перед построением. На основе этих двух графиков мы можем далее выбрать 10 признаков из этих 15, которые могут численно лучше различать исправные и неисправные образцы.
На рисунке 6 показана тепловая карта, построенная с использованием 15 признаков, предварительно отобранных, и цвет в каждой ячейке представляет степень корреляции между соответствующими горизонтальным и вертикальным признаками. Чем темнее ячейка, тем сильнее корреляция между двумя признаками, и наоборот. Как показано на рисунке 6, в качестве примера берутся три признака № 240, 241 и 242. Они сильно коррелируют друг с другом, что указывает на то, что они представляют в основном одно и то же значение. Значение построения тепловой карты заключается в выборе одного или двух из сильно коррелированных признаков в качестве окончательного выбора, чтобы избежать напрасной траты дополнительных ресурсов в процессе обучения из-за избыточности признаков.
Конкретные значения пяти признаков S.M.A.R.T., отобранных после вышеуказанной обработки, следующие:
- S.M.A.R.T. 1: Частота ошибок чтения (Raw read error rate). Этот атрибут относится к количеству ошибок, возникающих, когда головка считывает данные на поверхности диска. Обычно это 0. Для жестких дисков Seagate этот атрибут может быть большим значением, но это нормально, и все в порядке, если он больше не увеличивается.
- S.M.A.R.T. 7: Частота ошибок позиционирования (Seek error rate). Этот атрибут представляет количество ошибок, генерируемых головкой в процессе поиска. Обычно это 0. Есть много факторов, которые могут привести к росту этого значения, и часто это причины на аппаратном уровне, включая проблемы со средой поверхности диска и температурные аномалии. Аналогично признаку № 1, для Seagate этот признак нового жесткого диска также может быть большим значением, которое в норме будет уменьшаться в будущем.
- S.M.A.R.T. 187: Сообщенные неисправимые ошибки (Reported uncorrectable errors). Параметр, эксклюзивный для жестких дисков Seagate, который можно понять буквально, представляет количество ошибок, которые не могут быть решены аппаратным обеспечением, о которых сообщается операционной системе. Если это значение не равно нулю, это означает, что пользователю необходимо создать резервную копию данных жесткого диска.
- S.M.A.R.T. 198: Количество неисправимых секторов в автономном режиме (Offline uncorrectable sector count). Этот признак — кумулятивный счетчик неисправимых ошибок в секторе чтения/записи. Данные должны быть 0. Если этот параметр не равен нулю и растет, то произошла механическая проблема, и сектор должен быть поврежден. Если файл работает на поврежденном секторе, операционная система вернет сообщение об ошибке чтения диска и перемапит сектор при следующей записи в него.
- S.M.A.R.T. 240: Часы парения головки (Head flying hours). Параметр, который увеличивается со временем, например, время включения и общее количество операций чтения/записи, может быть приближен к возрасту жесткого диска и не имеет другого особого значения.
4.2.2. Стандартизация
Хотя признаки S.M.A.R.T. одной и той же модели жестких дисков все одинаковы, диапазон значений одной и той же модели жестких дисков с разными серийными номерами сильно различается. Если данные нормализованы обычным способом, они потеряют свои первоначальные характеристики. Согласно полученным ранее результатам экспериментов, обучение было очень плохим, если признаки всех данных были стандартизированы вместе для обработки данных.
Ввиду вышеуказанных проблем данные в этом эксперименте были стандартизированы блоками, то есть данные временных рядов каждого жесткого диска обрабатывались отдельно, и, наконец, все стандартизированные данные объединялись вместе. Этот метод стандартизации был доказан эффективным в предыдущей работе [2].
Как показано на рисунке 7, предполагается, что этот столбец данных содержит несколько групп признаков с периодом времени жесткого диска, равным четырем. Взяв данные двух жестких дисков в качестве примера, левый рисунок показывает результаты обычной стандартизации, то есть все данные стандартизируются вместе, и будет значительный разрыв между высокими и низкими значениями (разрыв больше в реальных данных). Правый рисунок — результат стандартизации блоков, то есть если данные каждого жесткого диска стандартизируются отдельно, диапазон результатов стандартизации будет находиться в стабильном диапазоне, что может отражать тенденцию изменения признаков отдельного жесткого диска в течение временного цикла. Это более способствует обработке данных, и модель также будет обучаться лучше.
4.3. Критерии оценки
Для несбалансированных данных нормальных и аномальных образцов коэффициент корреляции Мэттьюса является более подходящим выбором, чем другие критерии оценки, включая точность (accuracy), полноту (recall) и F1-меру [6].
Коэффициент корреляции Мэттьюса полностью учитывает истинно положительные и истинно отрицательные значения, чтобы получить хорошо сбалансированный показатель. Его значение варьируется от \(-1\) до \(1\), и значение \(-1\) означает, что прогнозируемое значение является полной противоположностью фактическому значению. Когда значение равно \(0\), прогнозный эффект хуже, чем случайное угадывание. Чем ближе значение к \(1\), тем лучше прогнозный эффект. Когда оно равно \(1\), это означает, что это идеальный классификатор, хотя идеального классификатора не существует. Уравнение для расчета коэффициента корреляции Мэттьюса следующее:
\[MCC=\frac{TP\times TN-FP\times FN}{\sqrt{(TP+FP)(TP+FN)(TN+FP)(TN+FN)}}\]
где \(TP\), \(FP\), \(FN\) и \(TN\) соответственно представляют истинно положительные, ложноположительные, ложноотрицательные и истинно отрицательные значения.
4.4. Эксперименты и результаты
Программная среда эксперимента — Windows 10, которая оснащена процессором Intel Core i5-11260H CPU@2.60GHz, 16 ГБ ОЗУ и мобильным графическим процессором NVIDIA GeForce RTX 3050. Используемый алгоритм глубокого обучения — Pytorch 1.10.2.
Используя вышедшие из строя образцы жестких дисков Seagate модели ST4000DM000 и образцы за 14 дней до аномалии, временной промежуток — с 2016 по 2022 год. Всего было построено 12 наборов экспериментов без перекрестных данных, чтобы исследовать экспериментальные результаты при разных соотношениях обучающего набора к тестовому. После одинаковой стандартизированной обработки данных классификаторы случайный лес, GBDT, XGBoost и AdaBoost использовались в качестве первого слоя, а нейронная сеть BP использовалась в качестве второго слоя для экспериментов и записывалась как группа смешивания A (blending group A). Логистическая регрессия, k-ближайших соседей, метод опорных векторов и гауссовский наивный байесовский классификатор использовались в качестве первого слоя, а нейронная сеть BP использовалась в качестве второго слоя для экспериментов и записывалась как группа смешивания B (blending group B). Результаты этих двух групп экспериментов сравнивались с результатами, полученными с использованием традиционных методов.
До этого, чтобы дополнительно проверить достоверность наших экспериментальных результатов, мы попытались воспроизвести трехслойную модель LSTM со стекингом [6] для сравнительных экспериментов, но, как показано на рисунке 8, ее функция потерь демонстрировала крайне нестабильное состояние, и колебания уменьшались при сокращении до двух слоев.
Поэтому мы изменили ее. После обработки только одним слоем LSTM и одним слоем dropout график функции потерь вел себя гораздо нормальнее (как показано на рисунке 9), и результаты тестов были лучше, чем у сложной модели. Предполагается, что форма данных после стандартизации была слишком простой, что приводило к тому, что у сложной модели появлялся серьезный пик колебаний, что приводило к снижению производительности модели; поэтому более простая модель была признана более подходящей для обработки данных такого рода.
Кроме того, чтобы дополнительно проверить обоснованность метода смешанного ансамблевого обучения, мы добавили LSTM к базовым ученикам, чтобы получить лучшие эффекты и критерий. Мы создали две дополнительные экспериментальные группы, удалив классификатор с наименее стабильным эффектом классификации или наименьшим влиянием на окончательный результат из базовых учеников двух исходных групп эксперимента Blending и заменив его на LSTM, таким образом получив группы смешивания C (Blending group C) и D (Blending group D) соответственно. Основываясь на наблюдении и анализе промежуточных результатов в ходе эксперимента, мы заменили XGBoost в базовом ученике группы смешивания A на LSTM и гауссовский наивный байесовский классификатор в базовом ученике группы смешивания B на LSTM, таким образом получив две новые модели ансамблевого обучения. Таблицы A1 и A2 в приложении дают значения параметров некоторых алгоритмов, а алгоритмы, не упомянутые, используют параметры по умолчанию.
После подготовки всего были проведены эксперименты. Наборы данных каждого года после обработки были разделены на 12 групп, и эксперименты повторялись, чтобы сделать результаты более убедительными путем усреднения. Результаты экспериментов показаны в таблице 4 и на рисунке 10.
Сравнение экспериментальных результатов моделей при различных соотношениях обучающего набора к тестовому (Значения, выделенные жирным шрифтом, являются лучшими результатами при одинаковых условиях).
Из результатов экспериментов мы видим, что метод смешанного ансамблевого обучения значительно улучшил критерий оценки. В большинстве экспериментальных групп результаты экспериментов с моделью LSTM лучше, чем при использовании только нейронной сети BP, но не лучше, чем методы смешанного ансамблевого обучения. Кроме того, из результатов в таблице 4 в большинстве случаев видно, что при добавлении LSTM к базовому ученику производительность может быть значительно улучшена. Линейная диаграмма на рисунке 11 более четко показывает изменения эффекта после добавления LSTM к базовым ученикам, что доказывает эффективность этого метода. Однако следует отметить, что в некоторых отдельных экспериментальных группах есть случаи, когда модель LSTM имеет наилучший эффект. Мы предполагаем, что при такой обработке набора данных, если соотношение обучающего набора к тестовому слишком велико или слишком мало, производительность модели LSTM будет плохой или результаты будут неточными. Поскольку общий объем наборов данных фиксирован, когда доля обучающих наборов слишком велика, количество тестовых наборов слишком мало, что приведет к недостаточной убедительности тестовых результатов. И наоборот, когда доля тестовых наборов велика, слишком мало обучающих наборов приведет к недостаточному обучению модели. Когда соотношение находится между 1:1 и 1:0,5, производительность сети LSTM может быть максимальной, и когда соотношение находится в районе этого значения, эффект модели больше соответствует ожиданиям. Однако этот вывод является лишь предположением и должен быть проверен последующими экспериментами.
Кроме того, по сравнению с прямым использованием метода нейронной сети BP, метод смешанного ансамблевого обучения также значительно сокращает время выполнения и повышает эффективность обучения и тестирования. В таблице 5 показано время обучения каждой модели в некоторых экспериментальных группах. Используемые нейронные сети BP имеют 10 000 эпох.
Частичное сравнение времени обучения моделей (Данные, выделенные жирным шрифтом, — самое короткое время выполнения при одинаковых условиях).
Причина такого разрыва во времени обучения заключается в том, что размер нового обучающего набора, используемого в методе смешанного ансамблевого обучения, уменьшен. Поскольку это часть исходного обучающего набора, размер обучающего набора фактически равен размеру разделенного проверочного набора, а сложность нового обучающего набора и тестового набора также снижена.
Наконец, чтобы проверить универсальность нашего метода, мы собрали данные для шести различных моделей жестких дисков. В дополнение к использованию жестких дисков Seagate того же производителя в качестве обучающих данных, мы собрали данные по жестким дискам двух разных производителей жестких дисков, Hitachi и Toshiba. Статистика для шести групп жестких дисков, используемых для тестирования, показана в таблице 6. Эти шесть различных моделей жестких дисков охватывают трех производителей и имеют емкость 4 ТБ, 8 ТБ, 12 ТБ и 16 ТБ, а количество вышедших из строя жестких дисков в статистике колеблется от 79 до почти 1000.
Статистика других моделей жестких дисков, используемых для тестирования.
Наборы данных шести новых моделей были обработаны с отбором признаков и предварительной обработкой таким же образом, и все данные жестких дисков модели ST4000DM000, использованные в экспериментах выше, были использованы в качестве обучающего набора для тестирования шести новых наборов данных в таблице 6. Полученные результаты показаны в таблице 7.
Результаты тестирования на различных типах жестких дисков (Значения, выделенные жирным шрифтом, являются лучшими результатами при одинаковых условиях).
Как видно из результатов, полученных в таблице 7, модель хорошо обобщает, и по сравнению с моделью, полученной методом ансамблевого обучения, результаты традиционных моделей машинного или глубокого обучения, таких как случайный лес, нейронная сеть BP и LSTM, показывают плохую устойчивость. Наиболее очевидное улучшение LSTM в методе смешивания наблюдается в эксперименте на жестком диске производителя Hitachi. Стоит отметить, что наборы признаков S.M.A.R.T., отфильтрованные для жестких дисков Hitachi, имеют большой разрыв по сравнению с дисками Seagate, поэтому первоначальная производительность низкая. Однако, поскольку подавляющее большинство признаков S.M.A.R.T. одинаковы для разных моделей жестких дисков, выравнивание признаков после сравнения ранее полученных тепловых карт (как показано на рисунке 6) может значительно улучшить результаты тестирования. Поэтому при тестировании других моделей жестких дисков самое важное — выровнять признаки с высокой корреляцией среди отобранных признаков, чтобы можно было получить хорошие результаты.
Принимая во внимание все вышеуказанные экспериментальные результаты, можно видеть, что метод смешанного ансамблевого обучения использует меньший обучающий набор для достижения лучшего эффекта, а время выполнения значительно сокращается. Кроме того, эксперименты с другими моделями жестких дисков, включая диски одного и разных производителей, показали, что метод смешанного ансамблевого обучения не проявляет переобучения и обладает хорошей универсальностью. Таким образом, несколько экспериментальных результатов доказывают обоснованность и эффективность этого метода.
4.5. Поиск наилучшего сочетания
Выше мы доказали, что метод смешанного ансамблевого обучения может улучшить производительность модели. Далее мы стремимся найти комбинацию базовых учеников, которая может обеспечить хорошую производительность на многих моделях жестких дисков.
Поскольку каждый базовый ученик имеет разные сильные стороны обнаружения и точности для положительных и отрицательных образцов, метод ансамблевого обучения объединяет производительность каждого базового ученика, которые могут учиться друг у друга и дополнять друг друга, чтобы достичь более стабильной и эффективной модели. Взяв в качестве примера модель жесткого диска ST8000DM002, количество ложных срабатываний и пропусков в результатах каждого базового ученика показано в таблице 8.
Индивидуальные результаты тестирования для каждой модели на жестком диске модели ST8000DM002.
Из таблицы 8 мы видим, что метод случайного леса имеет лучшую и очень высокую точность обнаружения аномалий, но недостатком является то, что количество ложноотрицательных образцов слишком велико. Поэтому мы берем случайный лес в качестве одного из базовых учеников, а затем выбираем три модели классификации с самой низкой частотой ложноотрицательных результатов, а именно LSTM, GBDT и SVM, в качестве трех других базовых учеников. Мы используем эти четыре модели, чтобы сформировать новую модель ансамблевого обучения для тестирования тестового набора, и количество ложных срабатываний и пропусков составляет 9 и 23 соответственно. Коэффициент корреляции Мэттьюса равен 0.9723992. По сравнению с моделью случайного леса в отдельности, хотя количество ложных срабатываний немного увеличилось, количество пропусков значительно уменьшилось, и общая производительность превосходит каждую отдельную модель. Результаты эксперимента подтвердили нашу идею, и следующий эксперимент продолжался в соответствии с этой идеей.
Согласно вышеуказанной идее проверки, были проведены эксперименты на других пяти моделях жестких дисков, и была получена таблица 9.
Сравнение экспериментальных результатов нескольких комбинаций базовых учеников на различных моделях жестких дисков (Значения, выделенные жирным шрифтом, являются лучшими результатами при одинаковых условиях)
Наблюдая матрицы ошибок (confusion matrices), полученные с помощью каждого метода, протестированного на каждой модели жесткого диска, мы обнаружили, что их смещение производительности в основном стабильно, в то время как логистическая регрессия и KNN в основном всегда имеют большое количество ложных срабатываний и пропусков, поэтому мы исключили эти два классификатора при проведении экспериментов. Мы экспериментировали с несколькими ансамблевыми комбинациями на основе результатов статистики, и результаты показаны в таблице 9. Видно, что комбинация базовых учеников в последнем столбце достигла хороших результатов на шести наборах данных жестких дисков. Стоит отметить, что эксперимент AdaBoost на жестком диске Hitachi HM55C4040BLE640 достиг высокой производительности, которая не была доступна при других методах, поэтому в комбинациях без AdaBoost результаты на этой модели жесткого диска были плохими. Кроме того, для экспериментов на жестком диске Toshiba MG07ACA14TA результаты каждой комбинации фактически отличались только на один или два образца. Поэтому в целом комбинация случайного леса, SVM, AdaBoost и LSTM дала наилучшие результаты на большинстве моделей, а вторые лучшие результаты были схожими.
5 Выводы и перспективы
В этой статье мы предложили новый метод прогнозирования отказов на основе метода смешанного ансамблевого обучения, объединяющий машинное обучение и глубокие нейронные сети для решения проблемы прогнозирования отказов жестких дисков, и доказали его обоснованность и эффективность с помощью нескольких групп экспериментов. В предварительном эксперименте мы построили несколько групп моделей смешанного ансамблевого обучения в соответствии с производительностью базового ученика и провели более десяти групп экспериментов с использованием общедоступного набора данных, собранного компанией BackBlaze. Экспериментальные результаты сравнивались с результатами использования традиционных методов, включая нейронную сеть BP, случайный лес и LSTM в отдельности, с меньшими обучающими наборами и временем обучения, и были получены лучшие результаты. Далее мы провели эксперименты по обобщению.
- Мы используем диаграммы скрипки и тепловые карты для отбора признаков и выравнивания признаков в соответствии с корреляцией каждого признака на тепловой карте, что значительно повышает способность модели к обобщению.
- Чтобы найти модель, которая может давать хорошие результаты на всех моделях наборов данных жестких дисков, мы попробовали различные комбинации базовых учеников после изучения матриц ошибок, полученных каждым базовым учеником на каждом наборе данных, и, наконец, нашли ансамблевую модель, которая имеет наилучшую способность к обобщению.
Следующим шагом текущего плана является попытка спрогнозировать оставшийся срок службы жесткого диска, а не просто классифицировать данные жесткого диска как исправные или неисправные как задачу бинарной классификации. Помимо этого, попытка экспериментировать с более продвинутыми моделями также является главным приоритетом будущей работы.
Список литературы
- Bruce Allen. 2004. Monitoring hard disks with smart. *Linux Journal* 2004, 117 (2004), 9.
- Nicolas Aussel, Samuel Jaulin, Guillaume Gandon, Yohan Peierlin, Erica Faoili, and Sophie Chabridon. 2017. Predictive Models of Hard Drive Failures Based on Operational Data. In *IEEE International Conference on Machine Learning and Applications (ICMLA '17)*. 619-625. https://doi.org/10.1109/ICMLA.2017.00-92
- Bahman Bahmani, Benjamin Moseley, Andrea Vattani, Ravi Kumar, and Sergei Vassilvitskii. 2012. Scalable k-means++. *Proc. VLDB Endow.* 5, 7, 622-633. https://doi.org/10.14778/2180912.2180915
- Anhui Bai, Mingjin Chen, Siyuan Peng, Guojun Han, and Zhijing Yang. 2022. Attention-Based Bidirectional LSTM With Differential Features For Disk RUL Prediction. In *International Conference on Electronic Information and Communication Technology (ICEICT '22)*. 684-689. https://doi.org/10.1109/ICEICT55736.2022.906829
- Sebastian Frischbier, Jawad Tahir, Christoph Doblander, Arne Hormann, Ruben Mayer, and Hans-Arno Jacobsen. 2022. Detecting trading trends in financial tick data: the DEBS 2022 grand challenge. In *Proceedings of the 16th ACM International Conference on Distributed and Event-Based Systems* (Copenhagen, Denmark) *(DEBS '22)*. ACM, New York, NY, USA, 132-138. https://doi.org/10.1145/3524860.3539645
- Qinda Hai, Shuangwang Zhang, Chang Liu, and Guojun Han. 2022. Hard Disk Drive Failure Prediction Based on GRI Neural Network. In *IEEE/CIC International Conference on Communications in China (ICCC '22)*. 696-701. https://doi.org/10.1109/ICCC5548.2022.9880716
- Bianca Schroeder and Garth A. Gibson. 2007. Disk failures in the real world: what does an MTTF of 1,000,000 hours mean to you?. In *Proceedings of the 5th USENIX Conference on File and Storage Technologies* (San Jose, CA) *(FAST '07)*. USENIX Association, USA, 1-es.
- Jawad Tahir, Christoph Doblander, Ruben Mayer, Sebastian Frischbier, and Hans-Arno Jacobsen. 2021. The DEBS 2021 grand challenge: analyzing environmental impact of worldwide lockdowns. In *Proceedings of the 15th ACM International Conference on Distributed and Event-Based Systems* (Virtual Event, Italy) *(DEBS '21)*. ACM, New York, NY, USA, 136-141. https://doi.org/10.1145/3465480.346536
- Laurens van der Maaten and Geoffrey Hinton. 2008. Visualizing Data using t-SNE. *Journal of Machine Learning Research* 9, 86 (2008), 2579-2605. http://jmlr.org/papers/v9/vandermaaten08a.html
- Yang Zhou, Fang Wang, and Dan Feng. 2022. A Disk Failure Prediction Method Based on Active Semi-supervised Learning. *ACM Trans. Storage* 18, 4, Article 35 (nov 2022), 33 pages. https://doi.org/10.1145/3523699