вернуться в раздел "Научные труды"
Источник: Личман, А. А. Сравнительный анализ методов машинного обучения на примере задачи классификации / А. А. Личман, О. Ю. Чередникова // Инновационные перспективы Донбасса : Сборник научных трудов 11-й Международной научно-практической конференции, Донецк, 27–29 мая 2025 года. – Донецк: Донецкий национальный технический университет, 2025. – С. 72-79. – EDN KWRZUE .

УДК 004.942

Сравнительный анализ методов машинного обучения на примере задачи классификации

Личман А.А., Чередникова О.Ю.

ФГБОУ ВО «ДОНЕЦКИЙ НАЦИОНАЛЬНЫЙ ТЕХНИЧЕСКИЙ УНИВЕРСИТЕТ», г. Донецк, ДНР

Аннотация

В статье сравниваются популярные алгоритмы машинного обучения в контексте задачи классификации «Ирисы Фишера», с целью выявить сильные и слабые стороны каждого из рассматриваемых методов в подобных задачах.

Abstract: The article compares popular machine learning algorithms in the context of the Fischer's Iris classification problem, in order to identify the strengths and weaknesses of each of the considered methods in similar tasks.

Ключевые слова: Алгоритмизация, Линейная регрессия, Деревья решений, Случайный лес, Ирисы Фишера, Классификация.

Key words: Algorithmizing, Linear regression, Decision trees, Random Forest, Fisher's Irises, Classification.

Общая постановка проблемы

В последние десятилетия развитие технологий машинного обучения и искусственного интеллекта значительно изменило подходы к решению множества задач в различных областях науки и техники. Современные алгоритмы интеллектуализации позволяют эффективно обрабатывать большие объемы данных, выявлять скрытые закономерности и строить модели, способные к самостоятельному обучению и принятию решений. В то же время, выбор оптимального алгоритма для конкретной задачи зачастую остается сложной проблемой, поскольку различные методы могут демонстрировать значительно различающиеся результаты в зависимости от типа данных, структуры задачи и других факторов.

Цель данной работы — провести статистическое сравнение нескольких популярных алгоритмов и выявить их достоинства и недостатки.

Полученные результаты позволят не только выявить сильные и слабые стороны каждого из рассматриваемых алгоритмов, в условиях решения задач классификации, но и обосновать рекомендации по выбору этих алгоритмов в той или иной задаче.

Описание набора данных для статистического моделирования алгоритмов

Задачи классификации – категория задач, где алгоритм должен отнести объекты к одной из заранее определенных категорий. Например, распознавание рукописных цифр, где цифры от 0 до 9 являются категориями, классификация писем на категории спам – не спам, оценка настроений в отзывах на категории соответствующие настроению, и многие другие [1]. Для статистического моделирования алгоритмов интеллектуализации будет использован классический набор данных «Ирисы Фишера».

Это классический набор данных, содержащий информацию о 150 образцах ирисов, разделенных на три класса (вида): Setosa, Versicolor и Virginica. Каждый образец в наборе данных описан четырьмя признаками: Длина чашелистика (sepal length), Ширина чашелистика (sepal width), Длина лепестка (petal length), Ширина лепестка (petal width). Все признаки являются числовыми и измеряются в сантиметрах. Задача алгоритма – распределить цветки по вышеуказанным категориям, основываясь на исходных данных. Итого, Ирисы Фишера – набор данных имеющих 3 класса и 4 признака.

Исследуемые алгоритмы машинного обучения

В ходе исследования рассмотрены следующие алгоритмы машинного обучения:

Решение задачи классификации с использованием логистической регрессии

Алгоритм линейной регрессии, в контексте задач классификации, а именно задачи Ирисы Фишера, имеет следующие входные и выходные данные: y — целевая переменная (класс ириса), а X = [x1, x2, x3, x4] это признаки, такие как длина и ширина чашелистика и лепестка. Предположим, что мы пытаемся предсказать вид ириса (y) на основе вышеуказанных признаков. Математическая модель линейной регрессии описывается следующей формулой:

Класс = β 0 + β 1 ( Длина чаш. ) + β 2 ( Ширина чаш. ) + β 3 ( Длина леп. ) + β 4 ( Ширина леп. ) + α

где β – коэффициенты, α – ошибка моделирования.

После того как модель обучена, можно получить значения для коэффициентов, интерпретируемых как влияние каждого признака на предсказание вида ириса. Ошибка отражает случайные отклонения, которые не могут быть объяснены линейной моделью.

Решение задачи классификации с использованием дерева решений

Алгоритм «Деревья решений», в контексте задач классификации, а именно задачи Ирисы Фишера, можно сформулировать следующим образом: алгоритм строит дерево, где каждый узел представляет собой решение о разделении данных по какому-либо признаку, а листья дерева содержат результаты классификации (в данном случае, виды ирисов: Setosa, Versicolor, Virginica).

Критерий разбиения: Индекс Джини. Для разбиения на каждом шаге дерева используется индекс Джини для оценки качества разделения. Чем ниже значение индекса Джини, тем «чище» будет разделение. Формула индекса Джини имеет вид:

Gini ( t ) = 1 i = 1 C p i 2

где Gini(t) – индекс Джини узла t; pi – доля объектов, принадлежащих классу i в данном узле; C – кол-во классов, в контексте ирисов Фишера 3.

Критерий разбиения: Энтропия. Используется для измерения неопределенности в данных. Чем выше энтропия, тем менее "чистым" является разделение. Чем ниже энтропия, тем однороднее данные в узле. Энтропия вычисляется по формуле:

Entropy ( t ) = i = 1 C p i log 2 p i

где Entropy(t) – энтропия узла t; pi – доля объектов, принадлежащих классу i в данном узле; C – кол-во классов.

Представим, что алгоритм применяет признак длины чашелистика (x1) для первого разбиения:

Каждое такое разбиение можно рассматривать как узел дерева, и на каждом шаге алгоритм будет выбирать такие пороговые значения для признаков, которые приводят к наибольшему улучшению в классификации [4].

Решение задачи классификации с использованием случайного леса

Алгоритм «Случайный лес», это ансамблевый метод, основанный на использовании нескольких деревьев решений, каждое из которых обучается на случайно выбранной подвыборке данных. Результаты всех деревьев агрегируются (например, с помощью голосования для классификации или усреднения для регрессии) для получения финального ответа. Этот метод значительно улучшает точность и устойчивость по сравнению с отдельными деревьями решений.

После того как все деревья построены, каждый объект классифицируется путем голосования среди деревьев [5]. В случае с несколькими классами итоговый класс выбирается как тот, который набрал наибольшее количество голосов. Формула для итогового предсказания имеет вид:

y ^ = arg max c C i = 1 N 1 ( y i = c )

где ŷ – итоговый предсказанный класс; yi – предсказание i-го дерева; C – кол-во классов; 1(yi = c) – индикаторная функция, которая равна 1, если yi = c, и 0 в противном случае.

Например, если на входном объекте одно дерево предсказало Setosa, второе — Versicolor, а третье — Setosa, то итоговым предсказанием будет Setosa, поскольку большинство деревьев проголосовало за этот класс.

Сравнительный анализ моделей классификации: прогнозы и реальные значения

Сравнительный анализ классификационных моделей был проведен с использованием программы на языке Python. В ходе анализа протестированы три модели машинного обучения, описанные выше. Для эксперимента использован стандартный набор данных "Ирисы Фишера". Модели обучены на первых двух признаках и использовали их для предсказания класса растения. Все три модели реализованы с использованием библиотеки scikit-learn, а результаты предсказаний проанализированы с точки зрения их точности и соответствия реальным значениям (рис. 1).

Результаты моделирования

Рисунок 1 – Результаты моделирования

Для визуализации результатов использовались графики, на которых продемонстрированы различия в подходах каждой модели к решению задачи классификации (рис. 2).

Результаты моделирования в виде графиков

Рисунок 2 – Результаты моделирования в виде графиков

Из списка индексов, где предсказания моделей совпадают с реальными значениями, можно выделить:

  1. Модели Decision Tree и Random Forest показали большее количество совпадений с реальными значениями, чем Logistic Regression, что может свидетельствовать о лучшей способности этих моделей учитывать сложные закономерности в данных.
  2. Logistic Regression и Random Forest имеют схожие результаты по части совпадений, однако Random Forest показал большую устойчивость, особенно в тех случаях, когда данные могли быть более шумными или слабо линейными.

Для каждого примера можно увидеть, какой метод наиболее точный:

В примерах 1, 4 и 5 ни одна из моделей не оказалась близкой к истине, что может свидетельствовать о сложности данных или их нестабильности для решения с помощью предложенных методов.

Преимущества и недостатки каждой модели

Decision Tree (Дерево решений): Показало хорошие результаты в случаях с чёткими границами между классами. Это метод, который легко интерпретировать, но может страдать от переобучения, особенно если данные содержат шум.

Random Forest (Случайный лес): Самая стабильная модель, показавшая наибольшее количество точных предсказаний. Случайный лес является устойчивым к переобучению, так как использует несколько деревьев решений и агрегацию их выводов. Это позволяет эффективно работать с большими и шумными данными, но может снижать интерпретируемость.

Logistic Regression (Логистическая регрессия): Хорошо справляется с линейными зависимостями, но её возможности ограничены в случаях с нелинейно разделимыми данными. Несмотря на это, она демонстрирует хорошую работу в задачах, где классы имеют чёткую линейную границу [6].

Выводы

Для задачи классификации ирисов Фишера, и схожих задач классификации случайный лес показывает наилучшие результаты по точности и устойчивости к различным данным. Он наиболее стабилен в разных случаях. Дерево решений остаётся хорошим выбором для простых и интерпретируемых моделей, но её склонность к переобучению и нестабильность делают её менее предпочтительной по сравнению с случайным лесом. Логическая регрессия показала свою ценность для линейных задач, однако для более сложных данных её эффективность может быть ограничена.

Таким образом, для данной задачи случайный лес является наиболее предпочтительным методом, но в зависимости от требований к интерпретируемости или вычислительным затратам могут быть рассмотрены и другие подходы, такие как дерево решений или логическая регрессия.

Перечень ссылок

  1. Alpaydin, E. (2020). Introduction to Machine Learning (4th ed.). MIT Press.
  2. Breiman, L. (2001). Random Forests. Machine Learning, 45(1), 5-32.
  3. Yarowsky, D. Unsupervised Word Sense Disambiguation Rivaling Supervised Methods / D. Yarowsky // Proceedings of the 33rd Annual Meeting of the Association for Computational Linguistics (ACL). – 1995. – P. 189-196.
  4. Голубев, И. В. Машинное обучение и его приложения / И. В. Голубев. – М.: Научная книга, 2019. – 344 с.
  5. Литвинова, И. А. Современные методы машинного обучения в задачах классификации и регрессии / И. А. Литвинова, Н. А. Савельева // Вестник Московского университета. Серия 2: Математика и механика. – 2020. – Т. 75. - № 3. – С. 47-58.
  6. Кузнецова, О. Н. Методология применения машинного обучения для решения задач классификации / О. Н. Кузнецова, Т. В. Герасимова // Журнал вычислительных методов и программирования. – 2021. – Т. 22. - № 5. – С. 89-98.