Аннотация: машинное обучение (ML) в настоящее время применяется во всех отраслях, включая инженерное дело, медицину и многие другие сферы. Подходы глубокого обучения основаны на искусственных нейронных сетях (ANNs), а также на другом типе сетей — стимулированных нейронных сетях (SSNs), которые выступают в качестве замены программных методов машинного обучения. Эмулируя структуру и функции нейронных сетей человеческого мозга, они стремятся воспроизвести коммуникацию между биологическими нейронами. Нейронные сети предоставляют множество надёжных новых методов для распознавания образов, анализа данных и автоматизации. Очень высокая скорость прогресса и способность находить решение задачи по набору примеров являются двумя их примечательными преимуществами. Данное исследование представляет обзор глубокой нейронной сети (DNN), являющейся подмножеством глубокого обучения. В этом обзоре предпринята попытка прояснить суть нейронных сетей и теорию, лежащую в их основе. Также рассматриваются преимущества и области применения нейронных сетей.

Ключевые слова: искусственные нейронные сети, машинное обучение, данные, ML.

Введение

Искусственные нейронные сети (ANNs) получают всё более широкое распространение в различных подотраслях и демонстрируют повышение успешности как модели для распознавания образов, классификации, группировки и прогнозирования. В настоящее время традиционные статистические и регрессионные модели конкурируют с ANNs, являющимися типом модели машинного обучения (ML), по своей полезности. Наиболее востребованными и интересными направлениями ИКТ на сегодняшний день являются искусственный интеллект (AI) (машинное обучение, нейронные сети, глубокое обучение, робототехника), информационная безопасность и большие данные, облачные вычисления, интернет и судебная экспертиза. Полные программные комплексы могут оцениваться с использованием метрик анализа данных, включающих точность, скорость обработки, задержку, производительность, отказоустойчивость, объём, масштабируемость и сходимость [1][3].

Изучение данной темы стало более актуальным, поскольку главным преимуществом ANNs является высокая скорость обработки, достигаемая при их массово-параллельной реализации. Примеры применения ANNs включают обработку естественного языка и распознавание изображений. Благодаря своим полезным характеристикам, таким как самообучение, адаптивность, отказоустойчивость, нелинейность и усложнение отображения вход–выход, ANNs теперь преимущественно используются для универсального аппроксимирования функций в численных моделях. Каждый слой узлов в искусственной нейронной сети (ANN) состоит из входного слоя, одного или нескольких скрытых слоёв и выходного слоя. Искусственный нейрон (узел) соединён с другими узлами и обладает характеристиками, такими как вес, порог и другие. Любой узел, генерирующий выход, превышающий заданное пороговое значение, активируется и начинает передавать данные в вышележащий слой сети. В противном случае данные в следующий слой сети не передаются [4][6].

Развитие и повышение точности нейронных сетей со временем требуют обучающих данных. Глубокое обучение, являющееся ветвью машинного обучения, основано на искусственных нейронных сетях (ANNs) или стимулированных нейронных сетях (SSNs). Чтобы быстро группировать и классифицировать данные, эти алгоритмы обучения должны сначала повысить свою точность. После этого они могут использоваться как мощные инструменты вычислений и искусственного интеллекта. Задачи, требующие распознавания речи или изображений, могут быть выполнены за несколько секунд вместо многих часов, которые требуются для ручной проверки специалистами.

Обсуждение

2.1. Как работают нейронные сети и какова их функция?

Представим отдельную модель линейной регрессии для каждого узла, со входными данными, весами, смещением (или порогом) и выходом. Расчёт выглядит следующим образом:

После задания входного слоя применяются веса. Эти веса позволяют оценить значимость каждой переменной: большие веса оказывают большее влияние на результат, чем меньшие. Каждый вход умножается на соответствующий вес, после чего суммируется. Затем выход определяется функцией активации. Если выход превышает определённый порог, нейрон «срабатывает» (активируется), передавая информацию на следующий слой сети [6], [7]. Таким образом, выход одного узла влияет на вход следующего. Поскольку данные передаются слой за слоем, такая архитектура является прямой (feed-forward).

Рассмотрим, как бинарные значения могут быть использованы для представления одного узла. Для иллюстрации можно взять пример решения: идти на серфинг или нет (Да: 1; Нет: 0). Наш прогнозируемый результат (ŷ) — решение отправиться или нет. Предположим, что на ваше решение влияют следующие три фактора:

Есть ли волны? (Да: 1, Нет: 0).

Есть ли очередь? (Да: 1, Нет: 0).

Были ли недавно атаки акул? (Да: 0, Нет: 1).

Пусть следующие наблюдения задают наши входные данные:

Волны сегодня есть (1).

Очереди нет (0).

Недавних нападений акул не было (1).

Теперь необходимо назначить вес каждому фактору. Более высокие веса означают более важное влияние на решение:

W1 = 5, поскольку крупные волны редки.

W2 = 2, так как вы привыкли к толпам.

W3 = 4, поскольку вы боитесь акул.

Выберем порог 3, что соответствует смещению -3. Подставляя данные:

ŷ = (15) + (02) + (1*4) – 3 = 6

Если использовать описанную выше функцию активации, то выход узла равен 1, так как 6 > 0. Обычно вы бы пошли на серфинг, но при изменении весов или порога модель может дать иной результат [8].

Хотя этот пример показывает принятие одного решения, нейронные сети позволяют формировать более сложные решения на основе выходов предыдущих слоёв. В математическом описании часто используются персептроны, однако в современных сетях применяются сигмоидные нейроны, принимающие значения от 0 до 1. Получение x в диапазоне [0,1] снижает влияние изменений одной переменной на выход узла и, следовательно, всей сети. По мере перехода к более прикладным задачам, таким как распознавание или классификация изображений, обучение нейронных сетей осуществляется на размеченных данных (обучающих выборках). Для оценки точности модели применяется функция потерь (cost function), обычно среднеквадратичная ошибка (MSE). Формула:

где:

• i — индекс образца,

• ŷ — прогнозируемое значение,

• y — истинное значение,

• m — число образцов.

Цель — минимизация функции потерь, обеспечивая точность предсказаний. Используя обучение с подкреплением и функцию потерь, модель корректирует свои смещения и веса для достижения точки сходимости (локального минимума). Метод обновляет веса с помощью градиентного спуска, позволяя модели выбирать оптимальное направление уменьшения ошибки. Ограничения модели постепенно снижаются по мере обучения на большем числе образцов. Большинство глубоких нейронных сетей работают в прямом режиме (feed-forward), где данные движутся только от входа к выходу. Однако модель можно обучать и методом обратного распространения (backpropagation), двигаясь от выхода к входу [9], [10]. Обратное распространение позволяет вычислить и классифицировать ошибки каждого нейрона, что даёт возможность правильно корректировать параметры. На рисунке 1 показана функция потерь.

Рисунок 1. Функция потерь [Google]

Заключение

Некоторые из областей применения, рассмотренные в исследовании, включают компьютерную безопасность, здравоохранение, промышленность, финансовые услуги, банковское дело, страхование, традиционные рынки, эксплуатацию генераторов, атомную промышленность, разведку полезных ископаемых, добычу, прогнозирование урожайности, качество сырой нефти, очистку сточных вод и управление политиками. «Step Into Deep Learning» — удобный и познавательный инструмент. В книге сочетаются теоретические объяснения с практическими примерами и рекомендациями по реализации, предоставляя читателям знания и инструменты для создания и обучения собственных моделей нейронных сетей. Создание обзора на основе текущих данных значительно помогает упорядочивать информацию и приносит коммерческую ценность всем заинтересованным сторонам. Инсайты ANN, в свою очередь, помогают преодолевать задачи и снижать риски. При оценке точности, скорости обработки, пассивности, производительности, открытости к отказам, объёма и масштабируемости методов ANN были учтены соответствующие аспекты анализа данных. Далее утверждается, что гибридные модели с нейронными сетями и FFBP гораздо лучше справляются с решением задач, чем другие широко используемые методы. Исследование предлагает объединять генетические алгоритмы (GA) с гибридными моделями нейронных сетей для повышения реального качества работы с точки зрения эффективности и результативности. Современная вычислительная модель ANN позволяет быстро и эффективно решать широкий круг сложных задач реального мира. Широкое использование обработки информации связано с такими характеристиками, как высокая корреляция, отказоустойчивость, нелинейность, устойчивость к шуму и хорошая обобщающая способность.

Литература

[1] H. R. Boveiri, R. Khayami, R. Javidan, and A. Mehdizadeh, “Medical image registration using deep neural networks: A comprehensive review,” Comput. Electr. Eng., 2020, doi: 10.1016/j.compeleceng.2020.106767.

[2] W. Rawat and Z. Wang, “Deep convolutional neural networks for image classification: A comprehensive review,” Neural Computation. 2017. doi: 10.1162/NECO_a_00990.

[3] D. J. Miller, Z. Xiang, and G. Kesidis, “Adversarial Learning Targeting Deep Neural Network Classification: A Comprehensive Review of Defenses against Attacks,” Proc. IEEE, 2020, doi: 10.1109/JPROC.2020.2970615.

[4] A. Thakur, “Fundamentals of Neural Networks,” Int. J. Res. Appl. Sci. Eng. Technol., 2021, doi: 10.22214/ijraset.2021.37362.

[5] M. A. Ferrag, O. Friha, L. Maglaras, H. Janicke, and L. Shu, “Federated Deep Learning for Cyber Security in the Internet of Things: Concepts, Applications, and Experimental Analysis,” IEEE Access, 2021, doi: 10.1109/ACCESS.2021.3118642.

[6] H. Wang and D. Y. Yeung, “A Survey on Bayesian Deep Learning,” ACM Comput. Surv., 2020, doi: 10.1145/3409383.

[7] S. Mushtaq, M. M. Manjurul Islam, and M. Sohaib, “Deep learning aided data-driven fault diagnosis of rotatory machine: A comprehensive review,” Energies. 2021. doi: 10.3390/en14165150.

[8] Z. Ebrahimi, M. Loni, M. Daneshtalab, and A. Gharehbaghi, “A review on deep learning methods for ECG arrhythmia classification,” Expert Systems with Applications: X. 2020. doi: 10.1016/j.eswax.2020.100033.

[9] T. T. K. Tran, S. M. Bateni, S. J. Ki, and H. Vosoughifar, “A review of neural networks for air temperature forecasting,” Water (Switzerland). 2021. doi: 10.3390/w13091294.

[10] B. Alshemali and J. Kalita, “Improving the Reliability of Deep Neural Networks in NLP: A Review,” Knowledge-Based Syst., 2020, doi: 10.1016/j.knosys.2019.105210.