DOI: 10.18137/RNU.V9187.25.02.P.43
В работе выполнен анализ классического метода градиентного спуска и предложен способ динамического изменения шага обучения на основе вычисляемых параметров τ и p. Основной акцент сделан на алгоритме, который позволяет вычислять оптимальные значения параметров τ и p для минимизации времени обучения. Эксперименты демонстрируют, как изменения этих параметров влияют на скорость обучения для различных топологий нейронных сетей и функций активации. Результаты моделирования показывают, что правильный выбор τ и p может значительно сократить временные затраты при обучении нейронных сетей с фиксированной структурой. Использование этих параметров позволяет улучшить процесс обучения, предотвращая застревание в локальных минимумах и обеспечивая баланс между скоростью обучения и точностью результата. Исследования продемонстрировали эффективность адаптивного подхода при различных топологиях нейронных сетей и функциях активации. Представленные графики и численные расчёты показывают зависимость средней скорости обучения от выбранных параметров.
Ключевые слова: нейронная сеть, градиентный спуск, оптимизация, скорость обучения, адаптивные параметры, корректировка
Для цитирования: Сонина С.Д. Оптимизация времени обучения нейронных сетей с адаптивными параметрами скорости обучения // Вестник Российского нового университета. Серия: Сложные системы: модели, анализ, управление. 2025. № 2. С. 43 – 54. DOI: 10.18137/RNU.V9187.25.02.P.43
The paper analyzes the classical gradient descent method and suggests a method for dynamically changing the learning step based on the calculated parameters τ and p. The main focus is on an algorithm that allows calculating the optimal values of the parameters τ and p to minimize the training time. The experiments demonstrate how changes in these parameters affect the learning rate for various neural network topologies and activation functions. The simulation results show that the correct choice of τ and p can significantly reduce the time required for training neural networks with a fixed structure. Using these parameters allows to improve the learning process, preventing getting stuck in local minima and ensuring a balance between the learning rate and the accuracy of the result. Research has demonstrated the effectiveness of an adaptive approach for various neural network topologies and activation functions. The presented graphs and numerical calculations show the dependence of the average learning rate on the selected parameters.
Keywords: neural network, gradient descent, optimization, learning rate, adaptive parameters, correction.
For citation: Sonina S.D. (2025) Optimization of training time of neural networks with adaptive learning rate parameters. Vestnik of Russian New University. Series: Complex Systems: Models, analysis, management. No. 2. Pp. 43 – 54. DOI: 10.18137/RNU.V9187.25.02.P.43 (In Russian).
В современном мире нейронные сети (далее – НС) используются при решении сложных задач в области распознавания изображения, обработки естественного языка, финансового прогнозирования и медицинской диагностики. Стремительный рост объемов данных приводит к необходимости быстрого и точного обучения модели. Одной из основных задач при этом является оптимизации скорости обучения НС. Традиционный алгоритм обратного распределения ошибки выполняет корректировку весовых коэффициентов, тем самым позволяя минимизировать функцию потерь [1]. Хотя данный подход и эффективен, но имеет значительные ограничения при обучении сети с большим количеством слоев, поскольку требует значительных вычислительных ресурсов и времени. По этой же причине ограничивается применение данного алгоритма моделей, требующих частых обновлений или переобучения с использованием новых данных.
В работах [2–4] рассматривается возможность решения задачи скорости обучения с применением различных модификаций метода градиентного спуска, а также их эффективность при сохранении точности обучения модели. При неправильном выборе скорости обучения возможно замедление сходимости для достижения приемлемого уровня точности к колебаниям вокруг локального минимума и, как следствие, невозможность нахождения оптимального решения. При решении задач минимизации функции потерь методы Adam, RMSprop и Adagrad [5; 6] находят эффективное применение за счет использования адаптивных скоростей обучения. Несмотря на то, что данные методы успешно применяются при решении задач оптимизации, необходимо учитывать их ограничения, такие как повышенная чувствительность к начальным значениям или вероятность преждевременной сходимости.
Скорость обучения η – значение шага изменения весовых коэффициентов, которое влияет на приближение (удаление) к минимуму функции. В работе [7] описан классический метод градиентного спуска с фиксированным значением скорости обучения η = 0,1. Определено, что константное значение не всегда обеспечивает наилучший результат и тем самым ограничивает применение метода в реальной практике. Однако в результате проведенных исследований выявлено, что существует возможность уменьшения времени обучения, если параметр η на итерации n изменять в соответствии с выражением [2]
где η(n) – значение η на итерации n; η(n-1) – значение на предыдущей итерации; τ – коэффициент скорости изменения η(n), τ ∈ [0,1], устанавливается перед началом обучения; wijk(n) – значение i-го весового коэффициента из общего их числа W в j-м нейроне k-го слоя; p – пороговое значение, в соответствии с которым производится корректировка η(n).
В выражении сумму разностей абсолютных значений всех весовых коэффициентов j-го нейрона k-го слоя на текущей и предыдущей итерации. Как показано в работе [8], при приближении значения этого выражения к нулю, итерационный алгоритм градиентного спуска приближается к минимуму. Однако если при этом суммарная энергия ошибки не удовлетворяет условию, то он является локальным. В связи с этим в выражении (1) введены параметры p и τ, устанавливаемые перед началом процесса обучения. Их смысл заключается в обеспечении необходимого шага изменения весовых коэффициентов в процессе градиентного спуска при приближении алгоритма к минимуму.
Таким образом, имеются две зависимые переменные τ и p, определить значение которых аналитически не представляется возможным. Для их оценки численным методом разработан алгоритм и программное обеспечение, которое производит расчет времени выполнения процесса обучения НС при изменении параметров τ и p в некотором диапазоне, устанавливаемом априорно.
Алгоритм (Рисунок 1) реализован в программном обеспечении и проведен ряд экспериментов. При этом установлены следующие значения переменных: локальный цикл (используемый при обучении одного примера) – local_delta_min = 0,1 и local_count = 1000; глобальный total_delta_min = 0,01 и counter = 100; α = 0,1; параметры функции нормального распределения при рандомизации весовых коэффициентов и значений параметра наклона функции возбуждения нейронов – среднее m = 0, стандартное отклонение s = 0,01. Расчеты проводились для 100 дискретных значений τ ∈ [0…1] и 100 значений p ∈ [10-10 … 1].
Так, для сигмоидальной функции возбуждения нейронов в сети минимальной конфигурации (три нейрона, топология 2-1) отмечается следующая тенденция: поверхность значений возрастает от точки τ = 0 и p = 10-10 до точек диапазона τ = [0,9…1,0] и p = [10-9 … 10-1] и характеризуется значительной неравномерностью (Рисунок 2). Минимальное значение s = 0,47 (мс) получено при τ = 0,61 и p = 1. Следует отметить, что возрастание значений s не зависит от топологии НС с сигмоидальной функцией возбуждения нейронов.
В работах [9; 10] рассматривалось влияние архитектуры на эффективность обучения НС. Данные исследования показали, что увеличение количества скрытых слоев может как ускорить сходимость, так и привести к переобучению при неоптимальном подборе параметров. В качестве примера исследованы трехслойные НС вида 2-5-1 (Рисунок 3, а) и 5-10-2 (Рисунок 3, б).
При применении гиперболического тангенса в качестве функции возбуждения нейронов зависимость среднего значения скорости выполнения локального цикла обучения s (мс) от значений τ и p имеет вид, представленный на Рисунке 4.
В этом случае (Рисунок 4) также сохраняется значительная неравномерность, но, в отличие от предыдущего случая (сигмоидальная функция) поверхность значений убывает от точки τ = 0 и p = 10-10 до точек диапазона τ = [0,9…1,0] и p = [10-9 … 10-1]. Получено минимальное значение s = 0,4163 (мс) при τ = 0,64 и p = 10-1.
Также исследованы многослойные НС, в качестве примера приведены НС с топологиями 2-5-1 (Рисунок 5, а) и 2-3-3-3-1 (Рисунок 5, б). В связи с увеличением неравномерности тренд на убывание выражен значительно меньше.
Из результатов проведенных исследований становится понятно, что среднее значение скорости выполнения локального цикла обучения можно представить в виде двумерной случайной величины s(τ, p) и вычислить ее численные характеристики [11], такие как среднее значение M[s(τ, p)] и стандартное отклонение σ[s(τ, p)]. Используя возможности библиотеки NumPy языка программирования Python [12] для выполнения расчетов, получим следующую подпрограмму:
import numpy as np
def calculate_stats(data):
mean_val = np.mean(data)
std_val = np.std(data)
return mean_val, std_val
На Рисунке 6 представлены результаты расчетов среднего значения и стандартного отклонения для нейронной сети с конфигурацией 2-1 (см. Рисунок 2). Поскольку данные представляют собой двумерный массив, то также рассчитаны средние значения по τ и p.
Для зависимостей, представленных на Рисунке 3, а, б, результаты расчетов характеристик изображены на Рисунках 7, 8.
Как было установлено ранее, использование гиперболического тангенса приводит к значительному увеличению неравномерности полученных результатов. Поэтому расчет численных характеристик двумерной случайной величины s(τ, p) может быть полезным инструментом для анализа результатов исследований. В качестве примера на Рисунке 9 представлены результаты, полученные для нейронной сети, схема которой показана на Рисунке 4. Аналогичным образом результаты, соответствующие схемам, изображенным на Рисунке 5, а, б, представлены на Рисунках 10, 11 соответственно.
На основании приведенных результатов моделирования можно сформулировать основные положения метода уменьшения времени выполнения процесса обучения НС с учетом оценки значений коэффициента τ и порога p, в соответствии с которыми производится корректировка параметра скорости η(n).
Следует отметить, что целесообразность применения метода может наблюдаться в тех случаях, когда проектируемая НС предназначена для многократного обучения на различных входных данных без изменения ее структуры.
Поступила в редакцию: 18.04.2025 Received: 18.04.2025
Поступила после рецензирования: 15.05.2025 Revised: 15.05.2025
Принята к публикации: 30.05.2025 Accepted: 30.05.2025