К научным трудам

Источник: Cборник трудов 4-й международной научно-технической конференции «Облачные и распределенные вычислительные системы». — 2023. — С. 56-59.


УДК: 621.383.68.3: 681.785

СРАВНИТЕЛЬНЫЙ АНАЛИЗ RNN, LSTM И GRU ДЛЯ КЛАССИФИКАЦИИ ТЕКСТОВ

Mammadova L.R.

Институт информационных технологий, Баку, Азербайджан

Аннотация

В настоящее время исследования в области глубокого обучения ведутся очень активно. Рекуррентные нейронные сети (RNN) стали незаменимыми инструментами в области глубокого обучения для решения задач, связанных с последовательными данными, таких как анализ временных рядов и обработка естественного языка. В этой статье дается обзор сетей RNN и их двух влиятельных вариантов - сетей с закрытыми рекуррентными блоками (GRU) и сетей с длительной кратковременной памятью (LSTM). В этом исследовании нашей основной целью является эмпирическое сравнение производительности трех вариантов рекуррентных нейронных сетей (RNN), а именно RNN, сетей с длительной кратковременной памятью (LSTM) и закрытых рекуррентных единиц (GRU), в контексте классификации текста. Наша цель - определить, какая из этих архитектур дает наилучшие результаты с точки зрения точности классификации текста, принимая во внимание различные наборы данных и экспериментальные настройки. Проводя этот сравнительный анализ, мы стремимся предоставить исследователям и практикам ценную информацию для выбора наиболее эффективной модели для задач классификации текстов.

Ключевые слова: Рекуррентная нейронная сеть, долговременная кратковременная память, закрытый рекуррентный блок.

Введение

Обработка естественного языка (NLP) - это быстро развивающаяся область в области искусственного интеллекта. Благодаря использованию технологии NLP компьютеры теперь способны понимать, переводить и воспроизводить текст или голосовую информацию на человеческом языке. В целях обработки и понимания человеческого языка NLP использует широкий спектр моделей и техник. Модели для NLP могут использоваться для решения различных задач и приложений. В этой быстро развивающейся области исследователи экспериментируют и внедряют инновации.

NLP широко используется в различных отраслях промышленности. Вот несколько примеров разнообразных применений NLP: здравоохранение, новости и СМИ, анализ настроений, услуги переводчика и так далее.

В статье рассматриваются модели глубокого обучения RNN, LSTM и GRU, которые стали довольно популярными в последние годы [1]. Во второй части статьи представлена информация о моделях RNN, LSTM и GRU и их формулах. Краткий обзор наборов данных, которые мы использовали, представлен в третьем разделе, а в конце представлен проведенный нами эксперимент и его результаты.

Рекуррентная нейронная сеть

Рекуррентные нейронные сети (RNN) - это тип искусственной нейронной сети, предназначенной для обработки последовательностей данных [2]. Рекуррентные нейронные сети (RNN) названы так потому, что с результатами, основанными на предыдущих вычислениях, они корректно выполняют одну и ту же задачу для каждого элемента последовательности. Целью рекуррентных нейронных сетей (RNN) является обработка последовательных данных. Текст, аудио, видео и другие типы последовательных данных, включая временные ряды, являются приемлемыми.

Скрытое состояние RNN является его основной и наиболее важной характеристикой. Оно действует как память сети, собирая данные с более ранних временных шагов. В RNN для сохранения контекста и получения прогнозов, зависящих от всей входной последовательности, информация передается через рекуррентные соединения. Это делает RNN эффективной для задач, связанных с последовательными данными.

Сеть получает входные данные за один временной шаг. RNN использует общие веса для вычисления взвешенной суммы текущего входного сигнала и предыдущего скрытого состояния на каждом временном шаге. Для определения текущего скрытого состояния взвешенная сумма передается через функцию активации.

В процессе обучения RNN обучается с помощью обратного распространения во времени (BPTT). Для обновления параметров сети вычисляются градиенты, а минимизация функции потерь позволяет ей обучаться на основе последовательных данных.

Здесь некоторые уравнения показывают, как вычисляются скрытое состояние и выходные данные на каждом временном шаге [3]:

ℎ = g(Wx + Wh + b) (1)

y = g(Wh + b) (2)

𝑥 и 𝑦 бывают входными и выходными на шаг по времени Т, ℎ находится в скрытом состоянии от предыдущего шага, W, Wh и b – весовые матрицы и смещения. Эти уравнения определяют фундаментальный RNN. На основе предыдущего скрытого состояния и текущих входных данных скрытое состояние обновляется на каждом временном шаге.

К сожалению, RNN испытывают трудности с исчезающими градиентами и не способны поддерживать долгосрочную информацию. Эту проблему можно решить несколькими способами. Расширенные варианты RNN, такие как долговременная кратковременная память (LSTM) и блок стробирования рекуррентных данных (GRU), являются одними из наиболее эффективных и популярных подходов.

Длительная кратковременная память

Долговременная кратковременная память была впервые представлена Хохрайтером и Шмидхубером (1997). LSTM стала очень популярной для решения различных задач, связанных с моделированием последовательности и обработкой естественного языка [4]. Блок забывания, блок ввода, блок вывода и состояние ячейки являются четырьмя ключевыми компонентами сети LSTM [5].

Входной элемент (I) используется для оценки важности вновь полученной информации, предоставляемой входными данными. Этот элемент определяет, какие входные значения следует добавить к состоянию ячейки. Параметр "Забыть" (F) определяет, какая информация из предыдущего состояния ячейки должна быть сохранена, а какая должна быть забыта. Элемент вывода (O) выбирает, какая часть обновленного состояния ячейки будет использоваться в качестве выходных данных для текущего временного шага. Состояние ячейки отвечает за передачу информации в течение нескольких временных шагов [6].

Формулы LSTM:

I = σ(xU + hW + b) (3)

F = σ(xU + hW + b) (4)

O = σ(xU + hW + b) (5)

W – веса входных данных, U – веса повторений, b – смещение, h – предыдущее скрытое состояние на временном шаге t-1.

Закрытый рекуррентный модуль (GRU)

Управляемый рекуррентный модуль был создан по тем же причинам, что и LSTM:

GRU использует команды update и reset. Команда update определяет, какая часть новых входных данных должна использоваться для обновления скрытого состояния, а команда reset определяет, какая часть предыдущего скрытого состояния должна быть удалена. Обновленное скрытое состояние используется для вычисления выходных данных GRU [7].

Формулы GRU:

r = σ(Wh + Wx + b) (6)

z = σ(Wh + Wx + b) (7)

ĥ = tanh(W(r ∘ h) + Wx + b) (8)

h = r ∘ h + (1 - z) ∘ ĥ, (9)

где σ – функция сигмоиды, tanh – гиперболический тангенс, x – текущий ввод, W и b – весовые матрицы и смещения, ∘ – поэлементное умножение.

Эксперименты

В нашем эксперименте использовались четыре набора данных разного размера (см. табл. 1). Для оценки результатов использовался показатель точности (accuracy). На этапе обучения модели использовались 4 эпохи (epochs). Каждый полный проход по обучающему набору данных составляет одну эпоху.

Используемые наборы данных:

Таблица 1 - Результаты по точности для наборов данных
Модель Imdb Reviews Twitter Sentiment Emotions NLP AG News
RNN0.50060.44240.32210.4139
LSTM0.50010.44330.32700.9294
GRU0.50020.96920.33180.9263

После выполнения моделей RNN, LSTM и GRU для каждого из наборов данных было обнаружено, что модель GRU дает наилучшие результаты. Подводя итог, наше исследование раскрывает возможности Gated Recurrent Units (GRU) как конкурентоспособного и эффективного решения для моделирования последовательностей.

Вывод

В этой статье представлен сравнительный анализ моделей глубокого обучения RNN, LSTM и GRU для классификации текстов. Были взяты четыре набора данных разного размера, к которым были применены модели RNN, LSTM и GRU. Для оценки результатов использовался индекс точности. Результат эксперимента показывает, что модель GRU показала наилучший результат из трех примененных нами моделей.

Выбор модели, которая наилучшим образом соответствует вашим целям, ограничениям и сложности ваших данных, имеет решающее значение при изучении среды глубокого обучения. Поиск «лучшей» модели - это бесконечный процесс, поскольку глубокое обучение - это тема, которая постоянно развивается и открывает новые возможности для исследований.

Список литературы

  1. Hochreiter S., Schmidhuber J. Long short-term memory // Neural computation. Vol. 9, № 8. 1997. pp. 1735-1780.
  2. Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep learning. MIT press, 2016.
  3. Nielsen M. A. Neural networks and deep learning. San Francisco, CA, USA: Determination press. Vol. 25. 2015. pp. 15-24.
  4. Goodfellow I. et al. Deep Learning-Ian Goodfellow, Yoshua Bengio, Aaron Courville // Adapt. Comput. Mach. Learn. 2016.
  5. Alguliyev R. M., Aliguliyev R. M., Abdullayeva F. J. Deep learning method for prediction of DDoS attacks on social media // Advances in Data Science and Adaptive Analysis. Vol. 11, №. 01n02. 2019. pp. 1950002.
  6. Gers F. A., Schmidhuber J., Cummins F. Learning to forget: Continual prediction with LSTM // Neural computation. Vol. 12. №. 10. 2000. pp. 2451-2471.
  7. Schmidhuber J. Deep learning in neural networks: An overview // Neural networks. Vol. 61. 2015. pp. 85-117.