О себе Реферат Научные труды Индивидуальный раздел
Назад в библиотеку

Делаем прогнозирование отказов дисков SMARTер (умней)!

Университет Уэйна, Северо-Восточный университет

Источник: 18th USENIX Conference on File and Storage Technologies (FAST ’20), February 25–27, 2020, Santa Clara, CA, USA

Аннотация

Накопители на жестких дисках являются одним из наиболее часто заменяемых аппаратных компонентов и по-прежнему представляют сложность для точного прогнозирования отказов. В данной работе мы представляем анализ и результаты одного из крупнейших исследований по прогнозированию отказов дисков, охватывающего в общей сложности 380 000 жестких дисков в течение двух месяцев на 64 площадках крупного ведущего оператора центров обработки данных. Наши предложенные модели на основе машинного обучения прогнозируют отказы дисков с показателем F-меры 0.95 и коэффициентом корреляции Мэтьюса (MCC) 0.95 для 10-дневного горизонта прогноза в среднем.

1 Введение

Накопители на жестких дисках (HDD) продолжают оставаться ключевым фактором, лежащим в основе современных корпоративных вычислений и научных открытий, размещаясь в крупномасштабных центрах обработки данных. К сожалению, HDD являются не только наиболее часто заменяемыми аппаратными компонентами ЦОД, но и основной причиной отказов серверов [82]. Отказ HDD может привести к потере данных, недоступности сервиса, увеличению операционных затрат и экономическим потерям [42, 76]. Следовательно, сообщество систем хранения данных приложило значительные усилия для повышения надежности дисков и, в частности, прогнозирования их отказов [4, 9, 19, 23, 24, 36, 41, 51, 54, 58, 59, 85, 89, 92]. Несмотря на широкую изученность, эффективное прогнозирование отказов жестких дисков остается сложной задачей [83, 88], и поэтому сообществу систем хранения полезны полевые исследования надежности дисков [8, 37, 44, 53, 55, 60, 65, 77, 83, 88]. К сожалению, такие полевые исследования публикуются недостаточно часто и ограничены по размеру выборки [8, 9, 28, 30, 37, 60, 83, 88, 89].

Чтобы заполнить этот пробел, мы провели анализ отказов дисков в крупном масштабе, охватив 380 000 жестких дисков от пяти производителей, распределенных по 10 000 серверных стоек и 64 площадкам ЦОД в течение двух месяцев, размещенных у оператора корпоративного ЦОД — это одно из крупнейших исследований анализа отказов дисков, описанных в литературе [4, 9, 51, 83].

Впервые в этой статье демонстрируется, что прогнозирование отказов дисков можно сделать высокоточным, комбинируя данные о производительности дисков и данные о их местоположении с данными мониторинга дисков (технология Self-Monitoring, Analysis, and Reporting Technology — SMART-данные). Традиционно работы по прогнозированию отказов дисков в основном фокусировались на использовании SMART-данных — это основано на практических свидетельствах, что SMART-атрибуты (например, исправимые ошибки, температура, время раскрутки диска и т.д.) коррелируют со здоровьем диска и указывают на возможный отказ. Хотя эта традиционная точка зрения верна, как показали предыдущие работы, мы обнаружили, что SMART-атрибуты не всегда обладают сильной предсказательной способностью для прогнозирования отказов дисков на более длительных горизонтах прогноза для всех дисков (т.е., прогнозирование отказов за несколько дней до фактического отказа, а не за несколько часов). Это в основном связано с тем, что значения SMART-атрибутов часто не меняются достаточно часто в период, предшествующий отказу, и изменение часто становится заметным всего за несколько часов до фактического отказа, особенно в сложных для прогнозирования случаях.

С другой стороны, значения метрик производительности могут демонстрировать больше вариаций задолго до фактического отказа диска. Небольшой пример показан на рисунке 1 и рисунке 2. Мы наблюдаем, что метрики производительности вышедших из строя дисков могут действительно показывать отличительное поведение по сравнению со здоровыми дисками (Рисунок 2), в то время как SMART-атрибуты этого не делают (Рисунок 1). На Рисунке 1 SMART-атрибуты здоровых дисков показывают то же значение или схожую картину, что и отказавшие диски, расположенные на том же сервере, вплоть до момента отказа диска. Для метрик производительности, показанных на Рисунке 2, хотя тенденции отказавших дисков близки к здоровым, отказавшие диски могут сообщать о множестве резких скачков до фактического отказа. На графике показано только подмножество SMART-атрибутов, но другие также демонстрируют схожее поведение (наш метод описан

SMART-атрибуты здоровых и отказавших дисков перед отказом
Рисунок 1: SMART-атрибуты здоровых и отказавших дисков перед отказом.
Метрики производительности здоровых и отказавших дисков перед отказом
Рисунок 2: Метрики производительности здоровых и отказавших дисков перед отказом.

2 Предпосылки и Методология

Наконец, в этой статье показано, что прогнозирование отказов дисков можно дополнительно улучшить, включив информацию о местоположении дисков в ЦОД — аспект, который не исследовался в предыдущих работах по прогнозированию отказов дисков, поскольку, как правило, логи ЦОД по умолчанию не включают информацию о местоположении и организации дисков. Интуитивно добавление информации о местоположении для прогнозирования отказов дисков увеличивает предсказательную силу, поскольку расширяет охват условий эксплуатации дисков в ЦОД.

Диски, находящиеся в близком пространственном соседстве, с большей вероятностью подвержены влиянию одних и тех же факторов окружающей среды, таких как относительная влажность и температура, которые ускоряют отказ компонентов диска [55, 73]. В частности, физически близкие диски, вероятно, испытывают схожие уровни вибрации. Хотя вибрация не является частью SMART-атрибутов или метрик производительности, известно, что она влияет на надежность дисков [56, 65]. Следовательно, добавление информации о местоположении может учитывать диски, работающие в схожих условиях окружающей среды или эксплуатации, которые могут иметь схожие характеристики отказов. Наша оценка (Раздел 5) показывает, что добавление информации о местоположении к информации SMART-атрибутов действительно улучшает качество прогнозирования отказов, хотя, как и ожидалось, эффект не так велик, как от добавления метрик производительности к SMART.

Хотя использование комбинации SMART-атрибутов, метрик производительности и информации о местоположении, вероятно, улучшит качество прогнозирования отказов дисков, типы атрибутов и огромный объем объединенной информации почти неуправляем. Непонятно, какие атрибуты следует выбирать и как их использовать. Традиционные модели, основанные на правилах или аналитические модели, вряд ли смогут выявить скрытые взаимодействия между различными атрибутами одного типа (например, SMART) и разных типов (например, производительность против SMART). Поэтому для повышения эффективности нашего подхода мы используем преимущества моделей машинного обучения (ML) для использования таких скрытых взаимодействий, как это делалось в нескольких предыдущих работах по прогнозированию отказов дисков [9, 51, 54, 65, 89].

Наш основной вклад заключается не в разработке моделей на основе машинного обучения, построенных на основе хорошо изученных и зрелых моделей, таких как наивный байесовский классификатор (Bayes) [36], случайный лес (RF) [52], градиентный бустинг деревьев решений (GBDT) [29, 91] и сети с долгой краткосрочной памятью (LSTM) [23, 38]. Вместо этого, основная полезность нашего исследования заключается в предоставлении практических выводов, уроков о компромиссах, извлеченных при применении этих моделей, и оценке устойчивости модели. Кроме того, мы разрабатываем и оцениваем новую гибридную модель глубоких нейронных сетей, сверточную нейронную сеть с долгой краткосрочной памятью (CNN-LSTM) [2] для прогнозирования отказов дисков, которая достигает близкого к лучшему качества прогнозирования в большинстве тестовых случаев.

Значения SMART-атрибутов перед отказом жесткого диска
Рисунок 3: Значения SMART-атрибутов перед отказом жесткого диска, собираемые ежечасно, извлечены из открытого набора данных Baidu [40]. Легенда справа показывает идентификаторы SMART-атрибутов диска, определенные отраслевым стандартом [3], а «R» представляет сырое значение атрибута.

Резюме наших вкладов:

* В этой статье представлены результаты одного из крупнейших исследований по прогнозированию отказов дисков, охватывающего 380 000 жестких дисков в течение двух месяцев на 64 площадках ведущего оператора ЦОД. Наша структура прогнозирования отказов дисков и набор данных, использованный в этом исследовании, включая атрибуты производительности, SMART и местоположения, размещены по адресу http://codegreen.cs.wayne.edu/wizard.

* В этой статье представлены экспериментальные доказательства того, что атрибуты производительности и местоположения эффективны для улучшения качества прогнозирования отказов дисков. Мы показываем, что, как и ожидалось, модели на основе машинного обучения могут быть полезны для прогнозирования отказов дисков. Но, как мы обнаружили и обсуждаем в этой статье, при выборе модели существует несколько компромиссов. Мы также понимаем, обсуждаем и объясняем ограничения этих моделей. В этой статье приведены детали экспериментальной и оценочной методологии для эффективного прогнозирования отказов дисков.

* В целом, наша оценка показывает, что ни одна модель машинного обучения не является победителем во всех сценариях, хотя CNN-LSTM достаточно эффективна в разных ситуациях. Мы достигаем до 0.95 F-меры [66] и 0.95 балла MCC (коэффициент корреляции Мэтьюса) [10,35,43,71] для 10-дневного горизонта прогноза (см. Раздел 4 для определений F-меры и MCC). Мы показываем, что комбинирование SMART-атрибутов, метрик производительности и записей о местоположении позволяет нам прогнозировать отказы дисков с большим упреждением, хотя качество прогноза меняется с размером окна упреждения.

Это исследование охватывает данные о дисках и серверах, измеренные и собранные в крупном центре обработки данных. Набор данных охватывает более 64 площадок ЦОД, 10 000 серверных стоек и 380 000 жестких дисков примерно за 70 дней. Это соответствует примерно 2,6 миллионам устройство-часов [4,9,51,83]. Отметим, что в течение этого периода в ЦОД размещалось более двух миллионов жестких дисков, но не все они включены в наше исследование, потому что мы фокусируемся только на тех дисках, для которых есть данные журналов по всем трем аспектам: SMART, производительность и местоположение. Сбор и хранение данных о производительности и SMART активированы не для всех дисков из-за накладных расходов на производительность и соображений коммерческой чувствительности.

Далее мы оцениваем типы событий, связанных с дисками, зарегистрированных на площадках ЦОД, и описываем наше определение отказа диска. Затем мы обсуждаем все три типа данных, собранных и проанализированных для этого исследования: (1) SMART-атрибуты диска (наиболее часто используемые для прогнозирования отказов дисков в других исследованиях [4,19,79,87]), (2) данные о производительности и (3) данные о пространственном расположении дисков.

Таблица 1
SMART-атрибуты для анализа отказов дисков.
SMART-атрибуты для анализа отказов дисков

2.1 Определение отказа диска

Учитывая сложность отказов дисков, не существует общего, общепринятого универсального определения отказа диска [53]. Ошибки скрытых секторов (LSE) обычно считаются одной из наиболее распространенных ошибок дисков, вызывающих отказы. Однако крупномасштабное исследование отказов дисков [75] показывает, что небольшое количество LSE само по себе не обязательно указывает на то, что отказ диска произошел или неизбежен, но LSE могут вызвать деградацию производительности, что в конечном итоге может привести к «отказу» — когда такие сообщения об ошибках, как «система не может подключиться к диску» или «операция с диском превысила установленный лимит времени», рассматриваются как отказы диска и требуют замены диска. В этой статье мы считаем диск отказавшим, когда оператор производственного ЦОД считает необходимым заменить диск. IT-операторы производственного ЦОД, который мы изучаем, считают целесообразным заменить или отремонтировать диск, когда происходит сбой операции чтения/записи и диск не может нормально функционировать после перезапуска. Все остальные диски считаются здоровыми.

2.2 SMART-данные диска

Значения SMART-атрибутов генерируются и записываются системой мониторинга Self-Monitoring, Analysis and Reporting Technology (SMART) для жестких дисков, которая обнаруживает и сообщает о различных индикаторах надежности накопителя [3]. Количество доступных SMART-атрибутов превышает 50, но не все диски записывают все атрибуты постоянно. Для нашего исследования мы выбираем 14 SMART-атрибутов (Таблица 1) в качестве признаков для наших обучающих моделей, используя метод, описанный в Разделе 3. Более 97% наших дисков сообщали об этих атрибутах, и эти атрибуты также пересекаются с широко используемыми атрибутами для прогнозирования отказов дисков в других исследованиях [9,51,54,65,89]. В нашем исследовании эти SMART-атрибуты собираются непрерывно и отчитываются с ежедневной гранулярностью в течение всего периода сбора данных, аналогично предыдущим работам [37,54]. Как обсуждалось ранее, более частая отчетность SMART не обязательно улучшала качество прогнозирования в начале этого исследования, и поэтому использовалась отчетность раз в день.

В нашем исследовании мы рассматриваем два значения, соответствующих каждому SMART-атрибуту в Таблице 1: (1) сырое значение атрибута и (2) нормализованное значение атрибута. Сырые значения собираются непосредственно датчиками или внутренним программным обеспечением в дисках, и их интерпретация может быть специфичной для производителя диска. Нормализованные значения получаются путем отображения соответствующего сырого значения в один байт с использованием методов, специфичных для производителя. Более высокое нормализованное значение обычно указывает на более здоровое состояние, за исключением случаев циклов загрузки/выгрузки головок и температуры. Отметим, является ли более высокое (или низкое) сырое значение лучшим, часто зависит от самого атрибута. Например, более высокое значение «Reallocated Sectors Count» означает, что найдено и перераспределено больше поврежденных секторов (худший случай), в то время как более низкое значение «Throughput Performance» указывает на возможность отказа диска.

2.3 Данные о производительности

В нашем исследовании мы измеряем и собираем два типа метрик производительности, поддерживаемых ядром ОС, т.е. метрики производительности на уровне диска и на уровне сервера. Метрики производительности на уровне диска включают размер IOQueue, пропускную способность, задержку, среднее время ожидания операций ввода-вывода и т.д. Метрики производительности на уровне сервера включают активность ЦП, операции подкачки страниц и т.д. Метрики производительности отчитываются с почасовой гранулярностью, потому что мы обнаружили, что почасовая гранулярность эффективна для улучшения качества прогнозирования. Однако затраты на хранение всех метрик производительности могут стать значительными в масштабе и со временем, и это может повлечь значительные операционные расходы. Поэтому, как описано в Разделе 3, мы используем простой метод для сокращения количества метрик, используемых нашими ML-моделями, чтобы управлять качеством прогнозирования с низкими затратами на хранение.

2.3.1 Метрики производительности на уровне диска

В нашем исследовании мы измеряем и собираем в общей сложности 12 метрик производительности на уровне диска; все эти метрики используются в этой статье. В Таблице 2 показаны 12 метрик, связанных с отдельными дисками.

Различное значение «DiskStatus» представляет разные статусы работы диска. Например, 0, 1, 2, 4, 8, 16, 32, 64 и 128 указывают на состояние: исправен, инициализация, занят, ошибка, зависание, только чтение, выключение, ремонт и завершенный ремонт соответственно. «IOQueueSize» показывает количество элементов в очереди ввода-вывода. «NormalFile/TempFile_WriteSuccess_Throughput» представляет пропускную способность успешной записи обычных/временных файлов на диски. «NormalFile/TempFile_WriteWorkItem_SuccessQps» и «ReadWorkItem_SuccessQps» означают количество обычных/временных файлов, успешно записанных/прочитанных диском в секунду. Аналогично, «NormalFile_WriteWorkItem_QueueTime» указывает среднее время ожидания записи для дисков. «ReadSuccess_Throughput», «ReadWorkItem_ProcessTime» и «ReadWorkItem_QueueTime» указывают пропускную способность, время обработки и среднее время ожидания в процессе чтения дисков.

Таблица 2
Выбранные метрики производительности на уровне диска.
Выбранные метрики производительности на уровне диска

2.3.2 Метрики производительности на уровне сервера

Что касается метрик на уровне сервера, у нас есть 154 метрики, разделенных на 54 категории; каждая категория имеет разное количество метрик. Сначала мы извлекаем наиболее распространенные пары категория-метрика и убеждаемся, что более 97% серверов имеют эти метрики уровня сервера. Мы сокращаем количество метрик до 18, которые мы подаем в нашу модель машинного обучения, чтобы управлять компромиссом между качеством прогнозирования и затратами на хранение с помощью простого метода, описанного в Разделе 3. В Таблице 3 перечислены 18 метрик производительности уровня сервера и соответствующие им категории.

«Tcp_outsegs» отображает общее количество сегментов хранения диска, которые были отправлены, включая те, что на текущих соединениях, но исключая те, которые содержат только повторно переданные октеты. Аналогично, «tcp_insegs» показывает общее количество полученных сегментов хранения диска, а «tcp_currestab» представляет количество TCP-соединений, текущее состояние которых установлено или ожидает закрытия (close-wait). «Udp_outdatagrams» отображает общее количество отправленных UDP-датаграмм хранения диска. «Page_in» представляет количество данных, передаваемых с диска в память в секунду. Аналогично, «page_out» происходит при передаче данных из памяти на диск. Пакетов в секунду (PPS) — это мера пропускной способности сетевых устройств. Следовательно, «net_pps_receive» и «net_pps_transmit» указывают скорость успешного приема и передачи сообщений по каналу связи соответственно. Отметим, что данные о производительности также включают сетевые (TCP/UDP) метрики, некоторые из которых присутствуют в выбранных метриках уровня сервера; это говорит о том, что сетевая активность и активность диска могут быть коррелированы и, возможно, предсказывать отказы дисков в сочетании.

Таблица 3
Выбранные метрики производительности на уровне сервера и соответствующие категории.
Выбранные метрики производительности на уровне сервера

2.4 Данные о пространственном расположении дисков

Как отмечено в Таблице 4, наши диски распределены по более чем 50 площадкам и 10 000 стоек. Все диски напрямую подключены к серверу. Каждый диск имеет четыре уровня маркеров местоположения, связанных с ним: площадка, комната, стойка и сервер. На одном сервере может быть размещено несколько дисков. Несколько серверов могут находиться в одной стойке. В комнате несколько стоек, а на площадке может быть несколько комнат. Маркеры местоположения используются как для здоровых, так и для отказавших дисков. Отметим, что эти маркеры местоположения явно не указывают фактическую физическую близость между двумя дисками, поскольку физическое расстояние между двумя площадками или комнатами не фиксируется нашими координатами местоположения, и они не указывают на физическую близость внутри комнаты.

Таблица 4
Распределение дисков по площадкам и стойкам.
Распределение дисков по площадкам и стойкам

2.5 Прочие методологические соображения

Наше исследование прогнозирования отказов дисков тщательно спроектировано, чтобы избежать экспериментальных ловушек. Например, мы проверили, что частота отказов дисков примерно одинакова с течением времени на всех 64 площадках, потому что если большинство отказов происходит в одну и ту же неделю, это может исказить качество прогнозирования. Аналогично, мы убедились, что концентрация отказов дисков в пространстве не искажена. Хотя отказы в пространстве имеют неравномерное распределение, мы проверили, что плотность отказов в пространстве меняется со временем. Наша годовая частота отказов дисков ?1.36% согласуется с частотами отказов, наблюдаемыми в других ЦОД [47, 48, 49].

Мы отмечаем, что отсутствие SMART-данных или данных о производительности возможно и само по себе может указывать на здоровье системы. Например, если отказавшие диски наблюдают более высокую степень отсутствия данных, чем здоровые диски, и отказавшие диски не имели данных непрерывно в течение длительного периода (например, более горизонта прогноза), то только эта особенность могла бы предсказывать отказ диска с высокой степенью успеха. Однако в нашем случае мы наблюдали, что здоровые и отказавшие диски не имеют дисбаланса в плане отсутствующих данных. Более того, длина непрерывного отсутствия данных в большинстве случаев составляет менее одного дня, потому что у нас есть несколько типов данных: производительность и SMART. Вероятность одновременного отсутствия всех выборок из обеих групп мала — и если данные отсутствуют, это часто указывает на внезапный отказ диска/сервера или другие проблемы, связанные с инфраструктурой.

Мы также гарантируем, что отказы дисков не сконцентрированы только на одном конкретном производителе или ограничены только старыми дисками. Хотя наш набор данных включает нескольких производителей и диски разного возраста, мы проверили, что прогнозирование отказов не сводится к тривиальному знанию имени производителя или возраста диска — хотя эти признаки используются нашими моделями машинного обучения для улучшения качества прогнозирования. Мы исследовали обучение и построение ML-моделей, специфичных для производителя, но обнаружили, что это приводит к нескольким проблемам: (1) переобучение под конкретного производителя, (2) отсутствие переносимости между площадками и производителями, (3) управление несколькими моделями и (4) более низкое качество прогнозирования по сравнению с подходом, принятым в этой статье (нормализация атрибутов между производителями и дисками, как обсуждается в Разделе 3).

3 Выбор SMART-атрибутов и атрибутов производительности

В этом разделе мы представляем простой метод для сокращения выбора SMART-атрибутов и метрик производительности. Эти сокращенные метрики затем подаются в наши модели машинного обучения в качестве входных признаков. Если не указано иное, мы используем этот метод для выбора важных признаков и используем полученные признаки для представления результатов оценки. Однако можно возразить, что модели машинного обучения могут автоматически выводить важные признаки из всех входных признаков. Причина выполнения этого шага — продемонстрировать, что сокращение выбора признаков с помощью простого метода не ухудшает качество прогнозирования, как мы оцениваем в Разделе 5. Преимущество этого шага — экономия затрат на хранение. Хотя нашему исследованию потребовалось хранить все признаки (более 100), чтобы продемонстрировать эффективность сокращения выбора, в будущем операторы ЦОД могут использовать метод для экономии пространства хранения и снижения вычислительных затрат. Поскольку диапазон значений для различных атрибутов у разных дисков и производителей сильно различается, трудно проводить содержательные сравнения. Таким образом, мы предварительно обрабатываем SMART-атрибуты и метрики производительности с помощью мини-макс нормализации, чтобы обеспечить справедливое сравнение между ними согласно уравнению: \(x_{norm} = (x - x_{min})/(x_{max} - x_{min})\). Здесь \(x\) — исходное значение признака, \(x_{min}\) — минимальное, а \(x_{max}\) — максимальное значение признака (по всем наблюдениям). Мы используем 0 для представления значения NULL и помечаем постоянные признаки как 0. Далее мы используем индекс Юдена (J-Index) [27, 74] для сокращения выбора признаков.

3.1 Как работает J-Index (JIC)?

После нормализации признаков к шкале 0-1 мы устанавливаем серию кандидатов в пороги для каждого признака с шагом 0.01, начиная с 0 до 1. Для каждого кандидата на порог t мы вычисляем значение соответствующего J-Index [6]. Мы определяем классификацию J-Index (JIC) как:

\[J-Index = True Positive Rate + True Negative Rate - 1\]

\[= \frac{TP}{TP+FN} + \frac{TN}{TN+FP} - 1\]

Здесь T и F указывают, правильный ли результат предсказания; P и N обозначают, что диск классифицирован как отказавший (положительный) или здоровый (отрицательный). TP обозначает количество фактически отказавших дисков, которые правильно предсказаны как отказавшие, а TN обозначает количество здоровых дисков, которые правильно предсказаны как здоровые. Аналогично, FP обозначает количество здоровых дисков, которые ложно предсказаны как отказавшие, а FN обозначает количество отказавших дисков, которые ложно предсказаны как здоровые.

Более конкретно, предположим, что входной признак — это Power-On Hours, и распределение выглядит как на Рисунке 4 для текущего кандидата на порог t (t = 0.58 в данном примере). Мы вычисляем процент отказавших дисков, распределенных в левой части от t, что составляет 42.11%, т.е. TP = 42.11%. Аналогично, у нас FN = 57.89%, FP = 21.30% и TN = 78.70%. Интуитивно мы предсказываем, что диск здоров, если его значение больше 0.58, иначе он отказал. Мы также вычисляем соответствующий J-Index на основе приведенного выше определения. Следуя этому методу, для конкретного признака у нас есть серия кандидатов на порог и их соответствующие J-Index. Диапазон J-Index от 0 до 1. Более высокий J-Index означает, что соответствующий кандидат на порог более различим для идентификации отказавших дисков среди здоровых. Следовательно, кандидат на порог с наивысшим J-Index выбирается в качестве лучшего (финального) порога для признака.

Интуитивно, классификация J-Index — это метод с низкими накладными расходами и практичный для внедрения IT-операторами и выполнения выбора признаков на своих наборах данных.

Пример классификации J-Index (JIC): Различение отказавших и здоровых дисков
Рисунок 4: Пример классификации J-Index (JIC): Различение отказавших и здоровых дисков. Верхняя кривая представляет отказавший диск, нижняя кривая — здоровый диск.

В Таблице 5 показаны J-Index (больше 0.1) для SMART-атрибутов. Четвертый и шестой столбцы (желтый цвет) представляют проценты дисков, которые меньше порога, в то время как пятый и последний столбцы (синий цвет) показывают проценты дисков, которые больше порога. Для каждого атрибута первый жирный шрифт указывает на истинно положительную скорость, а второй жирный шрифт обозначает истинно отрицательную скорость. Поскольку отказы не всегда должны быть значениями меньше порога, т.е. существуют верхние и нижние пороги для отказавших дисков, жирные значения для истинно положительной и истинно отрицательной скорости охватывают несколько столбцов.

Таблица 5
Наивысшие J-Index для SMART-атрибутов (R представляет сырое значение, N обозначает нормализованное значение).
Наивысшие J-Index для SMART-атрибутов

Подобно анализу SMART-атрибутов, мы хотим посмотреть, могут ли метрики производительности быть индикаторами отказов дисков. В Таблице 6 показана часть наивысших J-Index для метрик производительности, следуя тому же формату, что и в Таблице 5. Используя метод JIC, мы определяем набор наиболее информативных метрик производительности на уровне диска и сервера, которые указывают на надвигающиеся отказы дисков, т.е. мы выбираем метрики с наивысшими J-Index (больше 0.1). Мы также представляем лучшие (финальные) пороги для некоторых выбранных метрик в Таблице 5 и Таблице 6.

В отличие от SMART-атрибутов, метрики производительности имеют тенденцию к более высокой истинно положительной скорости и более низкой истинно отрицательной скорости. Мы наблюдаем, что хотя отдельная метрика производительности не идеальна для различения отказавших и здоровых дисков, она в целом имеет более высокий J-Index, чем большинство SMART-атрибутов на основе нашего набора данных. Это указывает на то, что метрики производительности, вероятно, являются предсказательными для отказов дисков.

Таблица 6
Наивысшие J-Index для метрик производительности.
Наивысшие J-Index для метрик производительности

Далее мы показываем, что метрики производительности отказавших дисков могут показывать различные отличительные паттерны перед отказом по сравнению со здоровыми дисками. Напомним, что всего есть 12 метрик производительности на уровне диска. Для каждого сервера, содержащего один или более отказавших дисков (отказавший сервер), мы извлекаем эти 12 метрик для каждого диска в течение 240 часов до того, как о дисках сообщается как об отказавших. Если на конкретном отказавшем сервере есть только один отказавший диск, мы сохраняем сырое значение отказавшего диска (RFD) и вычисляем среднее значение всех здоровых дисков (AHD) для каждого момента времени. Затем мы получаем разницу между RFD и AHD, которая указывает на разницу в реальном времени между сигнатурами отказавших и здоровых дисков на одном сервере. Если есть \(N\) (\(N\geq 2\)) отказавших дисков, то для каждого отказавшего диска мы вычисляем разницу между RFD и AHD для каждого момента времени.

Различные типы паттернов метрик производительности, наблюдаемые за 240 часов до отказа дисков
Рисунок 5: Различные типы паттернов метрик производительности, наблюдаемые за 240 часов до отказа дисков.

На Рисунке 5 показаны репрезентативные образцы разницы между кривыми RFD и AHD для различных атрибутов производительности на разных серверах. Чтобы более интуитивно раскрыть паттерны, мы используем сырые значения метрик для вычисления разницы между RFD и AHD, а не нормализованные значения на Рисунке 5. Все диски на одном сервере имеют одинаковое значение метрик производительности уровня сервера, и, следовательно, 18 выбранных метрик производительности уровня сервера не показаны на графике. Два верхних графика на Рисунке 5 иллюстрируют, что некоторые отказавшие диски сначала имеют схожее значение со здоровыми дисками, но затем их поведение становится нестабильным по мере приближения диска к надвигающемуся отказу. Два нижних графика на Рисунке 5 показывают, что некоторые отказавшие диски сообщают о резком скачке перед отказом, в отличие от более длительного неустойчивого поведения. Эти резкие скачки могут даже повторяться несколько раз. Мы не обнаружили таких паттернов для SMART-атрибутов до отказа в этом выбранном примере. Разнообразие паттернов демонстрирует, что прогнозирование отказов дисков с использованием метрик производительности нетривиально.

4 Постановка и решение ML-задачи

Определение проблемы. Мы формулируем проблему прогнозирования отказов дисков как задачу классификации. Конкретно, мы используем \(T=\{(input_i, label_i)\}_{i=1}^{n}\) для представления нашего обучающего набора данных, в котором \(input_i \in I\) обозначает все входные признаки. Здесь \(label_i \in \{0,1\}\) — бинарная переменная отклика для каждого диска \(i\): 0 указывает на здоровое состояние, а 1 — на состояние отказа. Наша цель — использовать лучший метод для изучения функции \(f: I \rightarrow \{0,1\}\), которая минимизирует функцию потерь \(\ell \left(h \left(input\right); label\right)\), измерение разницы между желаемым и фактическим выходом текущей модели, так чтобы обученная модель могла предсказывать отказы дисков \((label_i = 1)\) в течение определенного горизонта прогнозирования с высокой точностью.

Более конкретно, в процессе обучения предположим, что мы используем только один атрибут \(a\) в качестве входного признака. Для каждого диска у нас есть несколько показаний атрибута: \(a_1\), \(a_2\),..., \(a_n\) (\(j\) — время в \(a_j\)), и мы рассматриваем \(\{a_1,...,a_n\}\) как выборку. Поскольку вход алгоритма машинного обучения должен быть фиксированной длины периода наблюдения для каждой выборки, \(n\) должно быть фиксированным числом. Наша цель — предсказать отказ диска заранее, поэтому \(a_j\) в \(\{a_1,...,a_n\}\) должно быть значением здоровых состояний (здоровых дисков или здоровых состояний до отказа), т.е. \(a_j\) в \(\{a_1,...,a_n\}\) не содержит данных о состоянии отказа. Отметим, что мы стремимся предсказать, *потерпит ли диск отказ*, а не *точно когда* диск откажет в следующие десять дней.

Эффективные измерения. Для оценки эффективности наших подходов к прогнозированию мы используем точность (Precision), полноту (Recall), F-меру (F-measure) и коэффициент корреляции Мэтьюса (MCC). Точность [22] указывает долю TP среди всех предсказанных отказов. Полнота (или истинно положительная скорость, TPR) [81] представляет долю TP среди всех фактически отказавших дисков. Поскольку наша бинарная классификация сильно несбалансирована — здоровых дисков гораздо больше, чем отказавших — мы также используем F-меру [39, 69] и MCC [10] в качестве наших метрик оценки. F-мера — это гармоническое среднее точности и полноты и находится в диапазоне от 0 до 1 (чем выше, тем лучше). *Мы используем MCC, потому что это более сбалансированная мера, чем F-мера, особенно подходящая для несбалансированных данных. Она варьируется от 1 (идеальное предсказание) до -1 (инверсное предсказание).* Эти метрики определяются как:

\[Precision = \frac{TP}{TP+FP}\]

\[Recall (TPR) = \frac{TP}{TP+FN}\]

\[F-measure = \frac{2 \cdot Precision \cdot Recall}{Precision + Recall}\]

\[MCC = \frac{TP \times TN - FP \times FN}{\sqrt{(TP+FN)(TP+FP)(TN+FP)(TN+FN)}}\]

Предыдущие ML-модели и наши модели. Предыдущие работы были сосредоточены на использовании фундаментальных методов классификации и регрессии для прогнозирования отказов дисков [51, 9, 4]. Эти методы включают наивный байесовский классификатор (Bayes) [69], случайные леса (RF) [52], градиентный бустинг деревьев решений (GBDT) [29, 91] и сети с долгой краткосрочной памятью (LSTM) [28, 23]. Bayes — это семейство вероятностных классификаторов, основанных на применении теоремы Байеса. RF и GBDT — это типы традиционных ансамблевых методов машинного обучения, в то время как LSTM — это класс глубоких нейронных сетей (DNN). Поскольку предыдущие работы не рассматривали признаки производительности и местоположения для прогнозирования отказов дисков, мы реализуем и настраиваем модели Bayes, RF, GBDT и LSTM, чтобы использовать их в качестве прокси для предыдущих моделей прогнозирования отказов на основе обучения. Кроме того, мы рассматриваем модель на основе сверточной нейронной сети с долгой краткосрочной памятью (CNN-LSTM) [72]. Мы реализуем наши модели на Python, используя TensorFlow 1.5.0 [1], Keras 2.1.5 [34] и библиотеки Scikit-learn [64] для построения моделей.

Краткий обзор моделей и интуиция. Bayes [69] — это вероятностная модель машинного обучения, используемая для задач классификации. RF [52] и GBDT [29, 91] — это ансамблевые методы, которые построены из множества отдельных деревьев (называемых базовыми или слабыми учениками) и учитывают выводы всех деревьев для точных предсказаний путем усреднения или голосования.

Разница между RF и GBDT заключается в том, что RF генерирует деревья параллельным образом (алгоритм бэггинга) [52], в то время как GBDT выращивает деревья последовательно (алгоритмы бустинга) [29, 91]. Более конкретно, алгоритм бэггинга случайным образом берет выборки данных с возвращением из исходного набора данных для обучения каждого слабого ученика, что означает, что этап обучения генерации нескольких учеников параллелен (т.е., каждый ученик строится независимо). Алгоритм бустинга, однако, использует все данные для обучения каждого ученика и строит нового ученика последовательно, присваивая больший вес неправильно классифицированным образцам, чтобы уделить больше внимания улучшению их предсказуемости на этапе обучения.

С другой стороны, LSTM [38, 23] способна решать проблему долгосрочного распространения ошибки назад (итеративная корректировка весов связей сети для уменьшения значения функции потерь). LSTM включает ячейку памяти, которая стремится сохранять информацию относительно долгое время. Следовательно, LSTM эффективна для моделирования последовательных данных, и применение LSTM для прогнозирования отказов дисков исследовалось ранее [23]. Чтобы еще больше улучшить производительность LSTM в прогнозировании отказов дисков, мы объединяем CNN и LSTM в единую модель CNN-LSTM (CNN спереди и LSTM сзади), поскольку CNN и LSTM дополняют друг друга в возможностях моделирования — CNN предлагает преимущества в выборе лучших признаков, в то время как LSTM эффективна в обучении последовательным данным [2]. Выбор комбинации CNN и LSTM вдохновлен анализом, представленным Паскану и др. [63] — предполагается, что производительность LSTM может быть дополнительно улучшена за счет использования лучших признаков на входе, которые может предоставить CNN посредством уменьшения размерности [68]. Поэтому мы включаем подход CNN-LSTM, чтобы исследовать его эффективность в области прогнозирования отказов дисков.

Методология обучения и тестирования модели. Мы используем 5-кратную перекрестную проверку [50], которая представляет собой метод валидации для оценки предсказательной производительности моделей машинного обучения, оценки того, как модели работают на невидимом наборе данных (тестовом наборе) [70] и избежания проблемы переобучения. Более конкретно, наш набор данных случайным образом разбивается на пять подвыборок одинакового размера. Мы берем одну подвыборку в качестве тестового набора данных за раз, а оставшиеся четыре подвыборки — в качестве обучающего набора. Мы обучаем модель на обучающем наборе, оцениваем ее на тестовом наборе и вычисляем оценки оценки. После этого мы сохраняем оценки оценки и отбрасываем текущую модель. Процесс повторяется пять раз с различными комбинациями подвыборок, и мы используем среднее из пяти оценок оценки в качестве окончательного результата для каждого метода.

Настройка гиперпараметров моделей. Мы ищем наилучшие значения гиперпараметров для всех моделей с использованием метода hold-out [45], который дополнительно разделяет наши исходные данные фазы обучения на набор данных для настройки гиперпараметров (80% исходных данных фазы обучения) и набор данных валидации (20% исходных данных фазы обучения). Наибольшее различие между методом hold-out и подходом \(k\)-кратной перекрестной проверки (\(k\) относится к количеству подвыборок) заключается в том, что процесс обучения и валидации метода hold-out нужно запускать только один раз, в то время как \(k\)-кратная перекрестная проверка должна запускаться \(k\) раз. На этапе настройки гиперпараметров мы проводим поиск по сетке для построения и оценки моделей для каждой комбинации гиперпараметров, и цель — найти лучшую комбинацию с наивысшей производительностью. Например, для RF и GBDT мы проводим эксперименты с разным количеством деревьев (оценщиков) и останавливаемся на использовании 2000 деревьев в модели RF и 1000 деревьев в модели GBDT, поскольку использование более 2000 и 1000 деревьев соответственно не дает значительных улучшений на практике. Используя аналогичный метод, параметр сглаживания аддитивной Лидстона (\(\alpha\)) для Bayes [20] был установлен в 2.

Для моделей на основе LSTM после проведения поиска по сетке значений гиперпараметров для нахождения лучших комбинаций мы строим модель LSTM с четырьмя слоями и 128 узлами. Для CNN-LSTM в подмодуле CNN мы используем 1 одномерный сверточный слой спереди, за которым следует один слой макс-пулинга и один слой сглаживания (показано на Рисунке 6). 1D сверточный слой содержит 128 фильтров, которые интерпретируют снимки на основе входных данных. Слой макс-пулинга отвечает за консолидацию и абстрагирование интерпретации для получения двумерной матрицы признаков. Слой сглаживания преобразует матрицу в вектор, который подается в следующий классификатор. Модуль LSTM состоит из двух слоев LSTM и одного полносвязного слоя (dense layer). Мы эмпирически устанавливаем одинаковую скорость обучения 0.001 для моделей LSTM и CNN-LSTM и устанавливаем скорость отсева (drop-out rate) равной 0.25.

Структура CNN-LSTM
Рисунок 6: Структура CNN-LSTM.

Избегание переобучения моделей. Что касается LSTM и CNN-LSTM, одним из наиболее важных факторов является эпоха [32], которая указывает количество итераций обработки входного набора данных в процессе обучения. Более высокое значение эпохи уменьшит ошибку на обучающих данных; однако в критической точке сеть начинает переобучаться на обучающих данных. Следовательно, нахождение наилучшего значения эпохи необходимо для избежания переобучения. На Рисунке 7(а) показано изменение значения функций потерь на обучении и валидации (чем меньше, тем лучше) по мере увеличения эпохи. Изначально значения обеих функций потерь уменьшаются с увеличением значений эпохи; но после 32 эпох значение функции потерь на валидации медленно увеличивается (выше, чем на обучении), что указывает на проблему переобучения. Поэтому мы выбираем 32 эпохи для LSTM. Аналогично, мы выбираем 200 эпох для CNN-LSTM.

(a) Функция потерь на валидации достигает минимума на 32 эпохе для LSTM; далее она возрастает. (b) Среднеквадратическая ошибка (MSE) и её производная растут при горизонте прогноза более 10 дней.
Рисунок 7: (a) Функция потерь на валидации достигает минимума на 32 эпохе для LSTM; далее она возрастает. (b) Среднеквадратическая ошибка (MSE) и её производная растут при горизонте прогноза более 10 дней.

Наборы групп признаков. Мы рассматриваем различные входные наборы данных для оценки эффективности различных признаков: SMART-атрибуты (S), метрики производительности (P) и маркеры местоположения (L). Мы конструируем шесть групп, используя различные комбинации признаков: SPL, SL, SP, PL, S и P. В Таблице 7 показаны входные признаки для этих групп.

Выбор горизонта прогнозирования. Первый шаг в оценке ML-модели — определить, каким должен быть горизонт прогнозирования. Мы выбираем 10 дней в качестве нашего горизонта прогнозирования, т.е. мы стремимся определить, откажет ли данный диск в течение следующих 10 дней, аналогично предыдущим исследованиям [4, 9]. 10-дневный горизонт достаточно длителен для IT-операторов, чтобы предпринять ранние контрмеры. Мы также проводим анализ чувствительности, показывающий изменение значения средней квадратической ошибки (MSE) различных метрик для разной длины горизонта прогнозирования, как показано на Рисунке 7(b) (используя "ReadSuccessThroughput" в качестве репрезентативного примера), где MSE указывает среднюю квадратичную разницу между предсказанными и фактическими значениями [86]. Мы отмечаем, что производная MSE остается низкой до десяти дней, но увеличивается после десяти дней. Это поведение может немного варьироваться для разных признаков. Наш горизонт прогнозирования составляет 10 дней, если не указано иное в нашей оценке. Мы также оцениваем чувствительность моделей к горизонту прогнозирования (Раздел 5).

5 Результаты и анализ

В этом разделе мы представляем и анализируем результаты различных ML-моделей, их чувствительность к разным группам признаков, их ограничения, устойчивость и переносимость. Наше обсуждение включает подтверждающие доказательства и причины для объяснения наблюдаемых тенденций, а также последствия наблюдаемых тенденций для центров обработки данных. Сначала мы представляем ключевые метрики качества прогнозирования для всех моделей и наборов признаков (Рисунок 8). Мы делаем несколько интересных наблюдений:

  1. Мы наблюдаем, что группа признаков SPL показывает наилучшие результаты во всех ML-моделях, подтверждая нашу гипотезу, что признаки производительности и местоположения критически важны для повышения эффективности прогнозирования отказов дисков по сравнению с традиционными подходами на основе SMART-атрибутов.
  2. Добавление информации о местоположении улучшает качество прогнозирования в моделях, но улучшение ограничено по абсолютной величине (например, менее 10% для CNN-LSTM с точки зрения балла MCC). Интересно, что эффект информации о местоположении проявляется только при наличии признаков производительности. Метрики производительности дисков потенциально коррелируют с информацией о местоположении дисков. Следовательно, добавление маркеров местоположения может помочь ML-моделям усилить скрытые паттерны в метриках производительности.
  3. Хотя нет единой модели-победителя в разных группах признаков, CNN-LSTM работает близко к лучшей во всех ситуациях, достигая балла MCC 0.95 для группы SPL, по сравнению с баллом MCC 0.77 для RF (следующий лучший метод) для группы SPL. Далее мы строим график ложноположительных и ложноотрицательных скоростей для различных ML-моделей и групп признаков (Рисунок 9). Рисунок 9 выявляет интересные тенденции. Во-первых, модели на основе SMART-атрибутов имеют очень высокую ложноотрицательную скорость (FNR) (отказавшие диски предсказаны как здоровые) во всех моделях. Добавление признаков производительности и местоположения значительно снижает FNR и, следовательно, улучшает качество прогнозирования. Это также снижает ложноположительную скорость, но пространство для снижения уже ограничено.
  4. Наконец, мы наблюдаем компромисс между моделями в отношении различной доступности наборов признаков. Рисунок 8 показывает, что когда оператор ЦОД не собирает или не имеет доступа к признакам производительности, традиционные древовидные ML-модели (RF и GBDT) могут работать примерно так же хорошо, как сложные модели на основе нейронных сетей, такие как CNN-LSTM или LSTM. Фактически, модели RF и GBDT могут даже превзойти модель LSTM при отсутствии признаков P и L — это похоже на то, что показала недавняя работа, которая не рассматривала метрики производительности [4].

Наша работа показывает, что добавление признаков производительности и местоположения приводит к другому и новому результату. Также мы отмечаем, что модель CNN-LSTM требует гораздо больше времени на обучение по сравнению с простыми древовидными моделями (до четырех часов в нашем случае для одного процесса обучения); поэтому при отсутствии признаков производительности и местоположения модели RF и GBDT могут обеспечить столь же точные предсказания, и они могут быть предпочтительны для построения моделей только на основе данных SMART из-за относительно меньшего времени обучения.

Качество предсказания модели с разными группами признаков SMART (S), производительности (P) и местоположения (L)
Рисунок 8: Качество предсказания модели с разными группами признаков SMART (S), производительности (P) и местоположения (L).
Ложноположительная скорость (FPR) и ложноотрицательная скорость (FNR) модели
Рисунок 9: Ложноположительная скорость (FPR = FP/(FP + TN)) и ложноотрицательная скорость (FNR = FN/(TP + FN)) модели.

Далее мы исследуем, когда и как ML-модели не достигают высокой точности прогнозирования в пространстве и времени.

Ошибочно предсказанные отказы (синие) имеют тенденцию происходить в местах с низкой частотой отказов для всех моделей
Рисунок 10: Ошибочно предсказанные отказы (синие) имеют тенденцию происходить в местах с низкой частотой отказов для всех моделей. Каждая строка обозначает комнату, каждый столбец — стойку, т.е. пиксель j-го столбца и i-й строки представляет j-ю стойку в i-й комнате. Цвет каждого пикселя указывает процент отказавших дисков на стойке (пиксель).

Где ML-модели работают относительно плохо и почему? Рисунок 10 показывает, что ML-модели несколько менее эффективны в прогнозировании с высокой точностью и полнотой в областях, где концентрация отказов относительно ниже. Это разумно, поскольку ML-модели не могут собрать достаточное количество образцов отказавших дисков. По определению ML-модели менее эффективны для случаев, на которых они не обучались, или ситуаций, с которыми они ранее не сталкивались. Это наблюдение важно для операторов ЦОД, так как подчеркивает необходимость добавления маркеров местоположения в модели прогнозирования отказов дисков.

(a) Временное распределение ложноположительных срабатываний модели CNN-LSTM. (b) Временное распределение ложноотрицательных срабатываний модели CNN-LSTM.
Рисунок 11: (a) Временное распределение ложноположительных срабатываний модели CNN-LSTM. (b) Временное распределение ложноотрицательных срабатываний модели CNN-LSTM.

Когда ML-модели не могут предсказать и почему? Чтобы лучше понять ограничения ML-моделей, мы исследуем ложноположительные (здоровые диски, предсказанные как отказавшие) и ложноотрицательные (отказавшие диски, предсказанные как здоровые) предсказания. На Рисунке 11(a) показаны ложноположительные срабатывания, категоризированные по 20-дневным окнам для модели CNN-LSTM (другие модели дают схожие тенденции). Количество ложноположительных срабатываний очень низкое вначале, так как она предсказывает многие диски как здоровые, хотя они в конечном итоге отказывают в этом окне — и именно поэтому ложноотрицательные срабатывания высоки (Рисунок 11(b)). Это можно объяснить недостатком достаточных обучающих данных — модель ML не имеет достаточно данных и (консервативно) предсказывает, что диски здоровы. Эта тенденция действительно меняется со временем. Хотя доля ложноположительных срабатываний кажется очень высокой к последнему окну, мы отмечаем, что фактическое количество ложноположительных срабатываний довольно низкое (Рисунок 9). Это наблюдение указывает на необходимость достаточно длительных тестовых периодов, прежде чем делать выводы о качестве прогнозирования ML-моделей.

Переносима ли модель прогнозирования между площадками ЦОД? Операторы ЦОД часто увеличивают количество площадок со временем, и требуется время для построения моделей на новых площадках, а в некоторых случаях обучение моделей на новых площадках может быть невозможно из-за строгих причин коммерческой чувствительности. Поэтому мы хотим проверить, в какой степени модели прогнозирования отказов дисков на основе машинного обучения непригодны для переноса между площадками ЦОД? Можно ожидать, что условия эксплуатации и характеристики рабочей нагрузки меняются на разных площадках ЦОД, и, следовательно, модель прогнозирования отказов дисков может вообще не работать.

Как и ожидалось, это верно, если мы просто пытаемся обучить модель на одной площадке ЦОД и перенести ее на другую площадку (т.е., тестировать на другой невидимой площадке) — балл MCC может значительно упасть. Однако мы обнаружили, что обучение на нескольких площадках перед тестированием на новой невидимой площадке обеспечивает разумную точность. Мы протестировали на двух невидимых площадках ЦОД A и B, обучая нашу модель на остальных 62 площадках (Таблица 8 показывает результаты для площадки A; площадка B имеет схожие результаты). Наши результаты показывают, что качество прогнозирования по-прежнему остается достаточно высоким (например, >0.90 балл MCC для 10-дневного горизонта прогноза с использованием модели CNN-LSTM и признаков группы SPL). Мы не обнаружили значительного падения качества прогнозирования для какой-либо ML-модели; однако с некоторыми традиционными ML-моделями (RF и GBDT) качество прогнозирования не остается высоким (падение более чем на 15% в некоторых случаях). Операторам ЦОД следует быть осторожными при переносе ML-моделей прогнозирования как есть между площадками без достаточного обучения на нескольких площадках и следует предпочесть модели CNN-LSTM, если переносимость является требованием.

Таблица 8
Качество прогнозирования на невидимой площадке A.
Качество прогнозирования на невидимой площадке A

Эффективна ли модель прогнозирования при разных горизонтах прогноза (времени упреждения)? Чтобы проверить это, мы построили значения MCC для различных ML-моделей при разных временах упреждения (2-15 дней). На Рисунке 12 представлены баллы MCC для Bayes, RF, GBDT, LSTM и CNN-LSTM для группы SPL, когда горизонт прогноза составляет 2 дня, 5 дней, 10 дней и 15 дней. Как и ожидалось, качество прогнозирования действительно снижается с увеличением окна горизонта прогноза (балл MCC для 15-дневного окна составляет 0.89), но скорость снижения не является крутой для любой модели — ML-модели на основе признаков группы SPL эффективны даже при достаточно больших горизонтах прогноза.

Баллы MCC всех ML-моделей с признаками группы SPL для разной длины горизонта прогноза
Рисунок 12: Баллы MCC всех ML-моделей с признаками группы SPL для разной длины горизонта прогноза.

Снижает ли классификация J-Index для выбора признаков общую точность прогнозирования по сравнению с моделями, обученными на всех признаках? Напомним, что мы использовали классификацию J-Index для выбора признаков (различных метрик производительности и местоположения) для обучения наших моделей. Мы сравнили качество прогнозирования для моделей, использующих все признаки (Рисунок 13). Наши результаты показывают, что ручной выбор подмножества признаков с помощью J-Index дает схожие по качеству результаты, хотя он слегка влияет на компромисс между точностью и полнотой. Это примечательное наблюдение предполагает, что операторы ЦОД могут использовать J-Index для управления затратами на хранение атрибутов тысяч дисков без значительного риска для качества прогнозирования.

Сравнение CNN-LSTM с JIC и без JIC
Рисунок 13: Сравнение CNN-LSTM с JIC и без JIC.

6 Связанные работы

Насколько нам известно, предыдущие работы не рассматривали все три типа данных: SMART, производительность и местоположение для прогнозирования отказов. Вместо этого предыдущие работы полагались только на SMART-атрибуты [4, 19, 36, 41, 59, 79, 87]. Мы анализируем полевые данные крупного масштаба, собранные с одного из крупнейших сайтов электронной коммерции, в то время как большинство предыдущих работ предлагают методы прогнозирования на основе общедоступных данных Backblaze [4, 5, 7, 9, 62, 80]. Кроме того, анализируемые наборы данных были ограничены по размеру, типам производителей и часто были закрытыми [8, 9, 24, 28, 30, 31, 36, 37, 41, 51, 53, 58–60, 77, 83, 85, 88, 89, 92].

Большая часть предыдущих работ по прогнозированию отказов дисков ограничивается обнаружением зарождающихся отказов [9, 41, 59, 67, 84, 85]. Хотя Лима и др. [23] предложили подход для прогнозирования отказов дисков в долгосрочной и краткосрочной перспективе, они также ограничены SMART-атрибутами. Исследования Сандипа и др. [25, 26, 78] позволяют качественное понимание факторов, влияющих на надежность дисководов. Янг и др. [90] и Джерри Коул [21] оба достигают предсказаний надежности на основе ускоренных испытаний на долговечность. Кроме того, для прогнозирования отказов дисков были предложены непараметрические статистические тесты [58], модели Маркова [24, 92] и расстояние Махаланобиса [85]. Хьюз и др. [41] применили многомерный ранговый критерий и достигли 60% скорости обнаружения отказов (FDR).

В нашем исследовании мы фокусируемся на HDD, и некоторые предыдущие работы были сосредоточены на твердотельных накопителях (SSD). Три типичных исследования SSD основаны на данных, собранных Facebook [57], Google [77] и Alibaba Cloud [88]. Более того, Групп и др. [33] исследовали надежность флэш-памяти. Оуян и др. [61] изучали программируемые контроллеры SSD в компании веб-сервисов. Ряд исследований Кая и др. [11–18] исследовал различные паттерны отказов чипов флэш-памяти Multi-Level Cell (MLC). Ма и др. [53] обнаружили, что накопление перераспределенных секторов ухудшает надежность диска. Нараянан и др. [60] предложили подходы на основе машинного обучения для ответа на вопросы что, когда и почему отказов SSD.

В целом, немногие исследования отдельно использовали ML [4, 36, 54, 79] и DNN методы [4, 23] для прогнозирования отказов дисков. Наша работа исследует и сравнивает три классических метода ML с двумя DNN, используя шесть групп признаков для прогнозирования отказов дисков. Такой обширный анализ помогает нам получить такие выводы, как отсутствие необходимости использовать сложные DNN, когда доступны только данные SMART. Фактически, мы также первые, кто демонстрирует кросс-сайтовую переносимость различных моделей.

7 Заключение

Мы провели полевое исследование HDD на основе крупномасштабного набора данных, собранного из ведущего производственного ЦОД электронной коммерции, включая SMART-атрибуты, метрики производительности и маркеры местоположения. Мы обнаружили, что метрики производительности являются хорошими индикаторами отказов дисков. Мы также выяснили, что маркеры местоположения могут улучшить точность прогнозирования отказов дисков. Наконец, мы обучили модели машинного обучения, включая модели нейронных сетей, для прогнозирования отказов дисков с F-мерой 0.95 и MCC 0.95 для 10-дневного горизонта прогноза.

Благодарности

Авторы очень благодарны рецензентам и нашему руководителю, Кимберли Китон, за их конструктивные комментарии и предложения. Эта работа частично поддержана грантами Национального научного фонда (NSF) CCF-1563728 и 1753840.

Ссылки

  1. Martin Abadi, Paul Barham, Jianmin Chen, Zhifeng Chen, Andy Davis, Jeffrey Dean, Matthieu Devin, Sanjay Ghemawat, Geoffrey Irving, Michael Isard, et al. Tensorflow: a system for large-scale machine learning. In Proceedings of the 12th USENIX Symposium on Operating Systems Design and Implementation (OSDI), volume 16, pages 265-283, 2016.
  2. Abdulaziz M Alayba, Vasile Palade, Matthew England, and Rahat Iqbal. A combined CNN and LSTM model for arabic sentiment analysis. In International Cross-Domain Conference for Machine Learning and Knowledge Extraction, pages 179-191. Springer, 2018.
  3. Bruce Allen. Monitoring hard disks with SMART. Linux Journal, (117):74-77, 2004.
  4. Preethi Anantharaman, Mu Qiao, and Divyesh Jadav. Large scale predictive analytics for hard disk remaining useful life estimation. In Proceedings of the 2018 IEEE International Congress on Big Data (BigData Congress), pages 251-254. IEEE, 2018.
  5. Nicolas Aussel, Samuel Jaulin, Guillaume Gandon, Yohan Petetin, Eriza Fazli, and Sophie Chabridon. Predictive models of hard drive failures based on operational data. In Proceedings of the 16th IEEE International Conference on Machine Learning and Applications (ICMLA), pages 619-625. IEEE, 2017.
  6. Viv Bewick, Liz Cheek, and Jonathan Ball. Statistics review 13: receiver operating characteristic curves. Critical care, 8(6):508, 2004.
  7. Shivam Bhardwaj, Akshay Saxena, and Achal Nayyar. Exploratory data analysis on hard drive failure statistics and prediction. International Journal, 6(6), 2018.
  8. Richard Black, Austin Donnelly, Dave Harper, Aaron Ogus, and Anthony Rowstron. Feeding the pelican: Using archival hard drives for cold storage racks. In 8th USENIX Workshop on Hot Topics in Storage and File Systems (HotStorage), 2016.
  9. Mirela Madalina Botezatu, Ioana Giurgiu, Jasmina Bogojeska, and Dorothea Wiesmann. Predicting disk replacement towards reliable data centers. In Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD), pages 39-48, 2016.
  10. Sabri Boughorbel, Fethi Jarray, and Mohammed El-Anbari. Optimal classifier for imbalanced data using matthews correlation coefficient metric. PloS one, 12(6):e0177678, 2017.
  11. Yu Cai, Saugata Ghose, Erich F Haratsch, Yixin Luo, and Onur Mutlu. Error characterization, mitigation, and recovery in flash-memory-based solid-state drives. Proceedings of the IEEE, 105(9):1666-1704, 2017.
  12. Yu Cai, Erich F Haratsch, Onur Mutlu, and Ken Mai. Error patterns in MLC NAND flash memory: Measurement, characterization, and analysis. In Proceedings of the Conference on Design, Automation and Test in Europe (DATE), pages 521-526. EDA Consortium, 2012.
  13. Yu Cai, Erich F Haratsch, Onur Mutlu, and Ken Mai. Threshold voltage distribution in MLC NAND flash memory: Characterization, analysis, and modeling. In Proceedings of the Conference on Design, Automation and Test in Europe (DATE), pages 1285-1290. IEEE, 2013.
  14. Yu Cai, Yixin Luo, Erich F Haratsch, Ken Mai, and Onur Mutlu. Data retention in MLC NAND flash memory: Characterization, optimization, and recovery. In Proceedings of the 21st International Symposium on High Performance Computer Architecture (HPCA), pages 551-563. IEEE, 2015.
  15. Yu Cai, Onur Mutlu, Erich F Haratsch, and Ken Mai. Program interference in MLC NAND flash memory: Characterization, modeling, and mitigation. In Proceedings of the 31st International Conference on Computer Design (ICCD), pages 123-130. IEEE, 2013.
  16. Yu Cai, Gulay Yalcin, Onur Mutlu, Erich F Haratsch, Adrian Crista, Osman S Unsal, and Ken Mai. Error analysis and retention-aware error management for NAND flash memory. Intel Technology Journal, 17(1), 2013.
  17. Yu Cai, Gulay Yalcin, Onur Mutlu, Erich F Haratsch, Adrian Cristal, Osman S Unsal, and Ken Mai. Flash correct-and-refresh: Retention-aware error management for increased flash memory lifetime. In Proceedings of the 30th International Conference on Computer Design (ICCD), pages 94-101. IEEE, 2012.
  18. Yu Cai, Gulay Yalcin, Onur Mutlu, Erich F Haratsch, Osman Unsal, Adrian Cristal, and Ken Mai. Neighbor-cell assisted error correction for MLC NAND flash memories. In ACM SIGMETRICS Performance Evaluation Review (SIGMETRICS), volume 42, pages 491-504. ACM, 2014.
  19. Iago C Chaves, Manoel Rui P de Paula, Lucas G M Leite, Joao Paulo P Gomes, and Javam C Machado. Hard disk drive failure prediction method based on a Bayesian network. In Proceedings of the 2018 International Joint Conference on Neural Networks (IJCNN), pages 1-7. IEEE, 2018.
  20. Stanley F Chen and Joshua Goodman. An empirical study of smoothing techniques for language modeling. Computer Speech and Language, 13(4):359-394, 1999.
  21. Gerry Cole. Estimating drive reliability in desktop computers and consumer electronics systems. Seagate Technology Paper TP338, 2000.
  22. Jesse Davis and Mark Goadrich. The relationship between Precision-Recall and ROC curves. In Proceedings of the 23rd international conference on Machine learning, pages 233-240. ACM, 2006.
  23. Fernando Dione dos Santos Lima, Gabriel Maia Rocha Amaral, Lucas Goncalves de Moura Leite, Joao Paulo Pordeus Gomes, and Javam de Castro Machado. Predicting failures in hard drives with LSTM networks. In Proceedings of the 2017 Brazilian Conference on Intelligent Systems (BRACIS), pages 222-227. IEEE, 2017.
  24. Ben Eckart, Xin Chen, Xubin He, and Stephen L Scott. Failure prediction models for proactive fault tolerance within storage systems. In Proceedings of the 2008 IEEE International Symposium on Modeling, Analysis and Simulation of Computers and Telecommunication Systems (MASCOTS), pages 1-8. IEEE, 2008.
  25. Jon G Elerath and Sandeep Shah. Disk drive reliability case study: dependence upon head flyheight and quantity of heads. In Proceedings of the 2003 Annual Reliability and Maintainability Symposium (RAMS), pages 608-612. IEEE, 2003.
  26. Jon G Elerath and Sandeep Shah. Server class disk drives: how reliable are they? In Proceedings of the 2004 Annual Reliability and Maintainability Symposium (RAMS), pages 151-156. IEEE, 2004.
  27. Ronen Fluss, David Faraggi, and Benjamin Reiser. Estimation of the Youden Index and its associated cutoff point. Biometrical Journal: Journal of Mathematical Methods in Biosciences, 47(4):458-472, 2005.
  28. Daniel Ford, Francois Labelle, Florentina Popovici, Murray Stokely, Van-Anh Truong, Luiz Barroso, Carrie Grimes, and Sean Quinlan. Availability in globally distributed storage systems. In Proceedings of the 9th USENIX Symposium on Operating Systems Design and Implementation (OSDI), pages 61-74, 2010.
  29. Jerome H Friedman. Stochastic gradient boosting. Computational Statistics and Data Analysis, 38(4):367-378, 2002.
  30. Peter Garraghan, Paul Townend, and Jie Xu. An empirical failure-analysis of a large-scale cloud computing environment. In IEEE 15th International Symposium on High-Assurance Systems Engineering, pages 113-120. IEEE, 2014.
  31. Moises Goldszmidt. Finding soon-to-fail disks in a haystack. In HotStorage, 2012.
  32. Alex Graves and Jurgen Schmidhuber. Framewise phoneme classification with bidirectional LSTM and other neural network architectures. Neural Networks, 18(5-6):602-610, 2005.
  33. Laura M Grupp, John D Davis, and Steven Swanson. The bleak future of NAND flash memory. In Proceedings of the 10th USENIX Conference on File and Storage Technologies (FAST), pages 2-2, 2012.
  34. Antonio Gulli and Sujit Pal. Deep learning with Keras. Packt Publishing Ltd, 2017.
  35. Chongomweru Halimu, Asem Kasem, and SH Newaz. Empirical comparison of area under roc curve (AUC) and matthews correlation coefficient (MCC) for evaluating machine learning algorithms on imbalanced datasets for binary classification. In Proceedings of the 3rd International Conference on Machine Learning and Soft Computing, pages 1-6, 2019.
  36. Greg Hamerly, Charles Elkan, et al. Bayesian approaches to failure prediction for disk drives. In Proceedings of the Eighteenth International Conference on Machine Learning (ICML), volume 1, pages 202-209, 2001.
  37. Mingzhe Hao, Gokul Soundararajan, Deepak Kenchammana-Hosekote, Andrew A Chien, and Haryadi S Gunawi. The tail at store: a revelation from millions of hours of disk and SSD deployments. In Proceedings of the 14th USENIX Conference on File and Storage Technologies (FAST), pages 263-276, 2016.
  38. Sepp Hochreiter and Jurgen Schmidhuber. Long short-term memory. Neural computation, 9(8):1735-1780, 1997.
  39. George Hripcsak and Adam S Rothschild. Agreement, the F-measure, and reliability in information retrieval. Journal of the American Medical Informatics Association, 12(3):296-298, 2005.
  40. Song Huang, Song Fu, Quan Zhang, and Weisong Shi. Characterizing disk failures with quantified disk degradation signatures: an early experience. In Proceedings of the 2015 IEEE International Symposium on Workload Characterization (IISWC), pages 150-159. IEEE, 2015.
  41. G. F. Hughes, J. F. Murray, K. Kreutz-Delgado, and C. Elkan. Improved disk-drive failure warnings. IEEE transactions on reliability, 51(3):350-357, 2002.
  42. W. Jiang, C. Hu, Y. Zhou, and A. Kanevsky. Are disks the dominant contributor for storage failures?: a comprehensive study of storage subsystem failure characteristics. ACM Transactions on Storage (TOS), 4(3):7, 2008.
  43. G. Jurman, S. Riccadonna, and C. Furlanello. A comparison of mcc and cen error measures in multi-class prediction. PloS one, 7(8):e41882, 2012.
  44. S. Kadekodi, K. Rashmi, and G. R. Ganger. Cluster storage systems gotta have heart: improving storage efficiency by exploiting disk-reliability heterogeneity. In Proceedings of the 17th USENIX Conference on File and Storage Technologies (FAST), pages 345-358, 2019.
  45. J. Kim. Estimating classification error rate: repeated cross-validation, repeated hold-out and bootstrap. Computational statistics and data analysis, 53(11):3735-3745, 2009.
  46. A. Klein. What SMART stats tell us about hard drives. https://www.backblaze.com/blog/what-smart-stats-indicate-hard-drive-failures/, October 2016.
  47. A. Klein. Backblaze hard drive stats for 2017. https://www.backblaze.com/blog/hard-drive-stats-for-2017/, February 2018.
  48. A. Klein. Backblaze hard drive stats for 2018. https://www.backblaze.com/blog/hard-drive-stats-for-2018/, January 2019.
  49. A. Klein. Backblaze hard drive stats Q3 2019. https://www.backblaze.com/blog/backblaze-hard-drive-stats-q3-2019/, November 2019.
  50. R. Kohavi et al. A study of cross-validation and bootstrap for accuracy estimation and model selection. In International Joint Conference on Artificial Intelligence (IJCAI), volume 14, pages 1137-1145, 1995.
  51. J. Li, X. Ji, Y. Jia, B. Zhu, G. Wang, Z. Li, and X. Liu. Hard drive failure prediction using classification and regression trees. In Proceedings of the 44th Annual IEEE/IFIP International Conference on Dependable Systems and Networks (DSN), pages 383-394. IEEE, 2014.
  52. A. Liaw, M. Wiener, et al. Classification and regression by randomForest. R news, 2(3):18-22, 2002.
  53. A. Ma, R. Traylor, F. Douglis, M. Chamness, G. Lu, D. Sawyer, S. Chandra, and W. Hsu. RAIDShield: characterizing, monitoring, and proactively protecting against disk failures. In Proceedings of the 13th USENIX Conference on File and Storage Technologies (FAST), volume 11, pages 1-17, 2015.
  54. F. Mahdisoltani, I. Stefanovici, and B. Schroeder. Proactive error prediction to improve storage system reliability. In Proceedings of the 2017 USENIX Annual Technical Conference (ATC). Santa Clara, CA, pages 391-402, 2017.
  55. I. Manousakis, S. Sankar, G. McKnight, T. D. Nguyen, and R. Bianchini. Environmental conditions and disk reliability in free-cooled datacenters. In Proceedings of the 12th USENIX Conference on File and Storage Technologies (FAST), pages 53-65, 2016.
  56. B. S. Merrow. Vibration isolation within disk drive testing systems. November 6 2012. US Patent 8,305,751.
  57. J. Meza, Q. Wu, S. Kumar, and O. Mutlu. A large-scale study of flash memory failures in the field. In ACM SIGMETRICS Performance Evaluation Review, volume 43, pages 177-190. ACM, 2015.
  58. J. F. Murray, G. F. Hughes, and K. Kreutz-Delgado. Hard drive failure prediction using non-parametric statistical methods. In Proceedings of the International Conference on Artificial Neural Networks (ICANN), 2003.
  59. J. F. Murray, G. F. Hughes, and K. Kreutz-Delgado. Machine learning methods for predicting failures in hard drives: a multiple-instance application. Journal of Machine Learning Research, 6(May):783-816, 2005.
  60. I. Narayanan, D. Wang, M. Jeon, B. Sharma, L. Caulfield, A. Sivasubramaniam, B. Cutler, J. Liu, B. Khessib, and K. Vaid. SSD failures in datacenters: What? When? and Why? In Proceedings of the 9th ACM International on Systems and Storage Conference (SYSTOR), page 7. ACM, 2016.
  61. Jian Ouyang, Shiding Lin, Song Jiang, Zhenyu Hou, Yong Wang, and Yuanzheng Wang. SDF: software-defined flash for web-scale internet storage systems. In ACM SIGARCH Computer Architecture News (ASPLOS), volume 42, pages 471-484. ACM, 2014.
  62. Jehan-Francois Paris, SJ Thomas Schwarz, SJ Ahmed Amer, and Darrell DE Long. Protecting RAID arrays against unexpectedly high disk failure rates. In Proceedings of the IEEE 20th Pacific Rim International Symposium on Dependable Computing (PRDC), pages 68-75. IEEE, 2014.
  63. Razvan Pascanu, Caglar Gulcehre, Kyunghyun Cho, and Yoshua Bengio. How to construct deep recurrent neural networks. arXiv preprint arXiv:1312.6026, 2013.
  64. Fabian Pedregosa, Gael Varoquaux, Alexandre Gramfort, Vincent Michel, Bertrand Thirion, Olivier Grisel, Mathieu Blondel, Peter Prettenhofer, Ron Weiss, Vincent Dubourg, et al. Scikit-learn: Machine learning in Python. Journal of machine learning research, 12(Oct):2825-2830, 2011.
  65. Eduardo Pinheiro, Wolf-Dietrich Weber, and Luiz Andre Barroso. Failure trends in a large disk drive population. In Proceedings of the 5th USENIX Conference on File and Storage Technologies (FAST), volume 7, pages 17-23, 2007.
  66. David Martin Powers. Evaluation: from precision, recall and F-measure to ROC, informedness, markedness and correlation. Bioinfo Publications, 2011.
  67. Lucas P Queiroz, Francisco Caio M Rodrigues, Joao Paulo P Gomes, Felipe T Brito, Iago C Chaves, Manoel Rui P Paula, Marcos R Salvador, and Javam C Machado. A fault detection method for hard disk drives based on mixture of Gaussians and nonparametric statistics. IEEE Transactions on Industrial Informatics, 13(2):542-550, 2017.
  68. Oren Rippel, Jasper Snoek, and Ryan P Adams. Spectral representations for convolutional neural networks. In Advances in neural information processing systems, pages 2449-2457, 2015.
  69. Irina Rish et al. An empirical study of the naive Bayes classifier. In IJCAI 2001 workshop on empirical methods in artificial intelligence, volume 3, pages 41-46, 2001.
  70. Juan D Rodriguez, Aritz Perez, and Jose A Lozano. Sensitivity analysis of K-fold cross validation in prediction error estimation. IEEE transactions on pattern analysis and machine intelligence (TPAMI), 32(3):569-575, 2010.
  71. Kunal Roy, Supratik Kar, and Rudra Narayan Das. Understanding the basics of QSAR for applications in pharmaceutical sciences and risk assessment. Academic press, 2015.
  72. Tara N Sainath, Oriol Vinyals, Andrew Senior, and Hasim Sak. Convolutional, long short-term memory, fully connected deep neural networks. In Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 4580-4584. IEEE, 2015.
  73. Sriram Sankar, Mark Shaw, and Kushagra Vaid. Impact of temperature on hard disk drive reliability in large datacenters. In Proceedings of IEEE/IFIP the 41st International Conference on Dependable Systems and Networks (DSN), pages 530-537. IEEE, 2011.
  74. Enrique F Schisterman, Neil J Perkins, Aiyi Liu, and Howard Bondell. Optimal cut-point and its corresponding Youden Index to discriminate individuals using pooled blood samples. Epidemiology, pages 73-81, 2005.
  75. Bianca Schroeder, Sotirios Damouras, and Phillipa Gill. Understanding latent sector errors and how to protect against them. ACM Transactions on storage (TOS), 6(3):9, 2010.
  76. Bianca Schroeder and Garth A Gibson. Disk failures in the real world: What does an MTTF of 1, 000, 000 hours mean to you? In Proceedings of the 5th USENIX Conference on File and Storage Technologies (FAST), volume 7, pages 1-16, 2007.
  77. Bianca Schroeder, Raghav Lagisetty, and Arif Merchant. Flash reliability in production: The expected and the unexpected. In Proceedings of the 14th USENIX Conference on File and Storage Technologies (FAST), pages 67-80, 2016.
  78. Sandeep Shah and Jon G Elerath. Reliability analysis of disk drive failure mechanisms. In Proceedings of the 2005 Annual Reliability and Maintainability Symposium (RAMS), pages 226-231. IEEE, 2005.
  79. Jing Shen, Jian Wan, Se-Jung Lim, and Lifeng Yu. Random-forest-based failure prediction for hard disk drives. International Journal of Distributed Sensor Networks, 14(11), 2018.
  80. Chuan-Jun Su and Shi-Feng Huang. Real-time big data analytics for hard disk drive predictive maintenance. Computers and Electrical Engineering, 71:93-101, 2018.
  81. Yoshimasa Tsuruoka and Jun'ichi Tsujii. Boosting precision and recall of dictionary-based protein name recognition. In Proceedings of the ACL 2003 workshop on Natural language processing in biomedicine-Volume 13, pages 41-48. Association for Computational Linguistics, 2003.
  82. Kashi Venkatesh Vishwanath and Nachiappan Nagappan. Characterizing cloud computing hardware reliability. In Proceedings of the 1st ACM symposium on Cloud computing (SoCC), pages 193-204. ACM, 2010.
  83. Guosai Wang, Lifei Zhang, and Wei Xu. What can we learn from four years of data center hardware failures? In Proceedings of the 47th Annual IEEE/IFIP International Conference on Dependable Systems and Networks (DSN), pages 25-36. IEEE, 2017.
  84. Yu Wang, Eden W M Ma, Tommy W S Chow, and Kwok-Leung Tsui. A two-step parametric method for failure prediction in hard disk drives. IEEE Transactions on industrial informatics, 10(1):419-430, 2014.
  85. Yu Wang, Qiang Miao, Eden W M Ma, Kwok-Leung Tsui, and Michael G Pecht. Online anomaly detection for hard disk drives based on Mahalanobis distance. IEEE Transactions on Reliability, 62(1):136-145, 2013.
  86. Zhou Wang and Alan C Bovik. Mean squared error: Love it or leave it? a new look at signal fidelity measures. IEEE signal processing magazine, 26(1):98-117, 2009.
  87. Jiang Xiao, Zhuang Xiong, Song Wu, Yusheng Yi, Hai Jin, and Kan Hu. Disk failure prediction in data centers via online learning. In Proceedings of the 47th International Conference on Parallel Processing, page 35. ACM, 2018.
  88. Erci Xu, Mai Zheng, Feng Qin, Yikang Xu, and Jiesheng Wu. Lessons and actions: What we learned from 10K SSD-related storage system failures. In Proceedings of 2019 USENIX Annual Technical Conference (ATC), pages 961-976, 2019.
  89. Yong Xu, Kaixin Sui, Randolph Yao, Hongyu Zhang, Qingwei Lin, Yingnong Dang, Peng Li, Ke-ceng Jiang, Wenchi Zhang, Jian-Guang Lou, et al. Improving service availability of cloud systems by predicting disk error. In Proceedings of 2018 USENIX Annual Technical Conference (ATC), pages 481-494, 2018.
  90. Jimmy Yang and Feng-Bin Sun. A comprehensive review of hard-disk drive reliability. In Proceedings of Annual Reliability and Maintainability Symposium (RAMS), pages 403-409. IEEE, 1999.
  91. Jerry Ye, Jyh-Herng Chow, Jiang Chen, and Zhaohui Zheng. Stochastic gradient boosted distributed decision trees. In Proceedings of the 18th ACM conference on Information and knowledge management, pages 2061-2064. ACM, 2009.
  92. Ying Zhao, Xiang Liu, Siqing Gan, and Weimin Zheng. Predicting disk failures with HMM-and HSMM-based approaches. In Proceedings of the 2010 Industrial Conference on Data Mining (ICDM), pages 390-404, 2010.