УДК 004.912
М.Д. Аверина, О.А. Леванова
Ярославский государственный университет им. П.Г. Демидова
E-mail: maverina518@gmail.com, olaydy@gmail.com
Аннотация. В работе представлено решение задачи распознавания именованных сущностей для русскоязычных текстов при помощи рекуррентных нейронных сетей. Исследованы архитектуры LSTM, BiLSTM и их комбинации с CRF. Проведено тестирование моделей при различных параметрах предобработки текста и векторных представлений слов. Лучший результат показала модель BiLSTM и CRF с использованием fasttext, усредненное значение F-меры равно 0.85. Ключевые слова: рекуррентные нейронные сети, извлечение именованных сущностей, векторное представление слов, LSTM, BiLSTM, CRF, fasttext, wor2vec.
Введение
Задача извлечения именованных сущностей заключается в выделении из текста определенных непрерывных фрагментов. Например, в тексте необходимо выделить информацию о персонах, локациях, организациях, суммах или датах.
Данная работа является продолжением статьи [1], в которой были рассмотрены данные открытой базы судебной статистики, описана предобработка данных и методы извлечения признаков из текста. В качестве модели был взят метод CRF, который показал наилучший результат при использовании «самого слова», регулярных выражений и его соседей. В данной работе описан подход на основе рекуррентных нейросетевых архитектур для решения той же задачи.
На вход рекуррентная нейронная сеть должна получать последовательность, где каждый элемент характеризуется вектором чисел. Поэтому для векторного представления слов были рассмотрены модели fasttext (f), word2vec, bert embedding (bert), метод «мешок слов» со слоем Embedding. Модели fasttext и word2vec основываются на контекстной близости слов, поэтому для сокращения векторного пространства рекомендовано использовать нормализацию или стемминг [2]. Авторами была реализована возможность добавлять в векторное представление слова информацию о морфологических признаках (m) и на основе регулярных выражений (r). В отличие от предыдущей работы, были добавлены признаки, учитывающие наличие @ или цифр в слове. Также реализовано удаление стоп-слов (например: и, или, но и др.).
Следующим шагом были сформированы последовательности длины 20, где на каждой позиции находится векторное представление соответствующего слова [3]. Из текста формировался набор для обучения нейронной сети, при этом последовательности слов брались со сдвигом в 3 слова. Была реализована возможность сохранения структуры документа по абзацам, страницам и документам. Существует два способа формирования последовательностей: последовательности формируются по всему тексту целиком, последняя из них — завершающие 20 слов; по структурам данных, в случае недостаточного числа слов, последовательность дополняется нулями, либо специальным символом (pad).
Были исследованы модели LSTM, BiLSTM [3], и их комбинации с CRF. Тестирование показало, что использование стемминга и нормализации дает небольшой прирост качества, а для векторного представления лучшим оказался fasttext длины 100. Было установлено, что для некоторых сущностей следует использовать сохранение по абзацам, но при маленьком абзаце лучше использовать сохранение по страницам.
По результатам тестирования различных параметрах предобработки, длины последовательности и методов векторного представления слов были выбраны лучшие модели. Архитектуры LSTM и BiLSTM показали неудовлетворительный результат по сравнению с CRF, значение F-меры в среднем не выше 0.6. В таблице 1 представлены результаты работы моделей, а также их сравнение с методом CRF, для каждой сущности вычислялась F-мера.
| Сущность | CRF r3,v3 | BiLSTM и CRF bert | BiLSTM и CRF f, r, m | LSTM и CRF f, r, m |
|---|---|---|---|---|
| истец | 0.82 | 0.64 | 0.83 | 0.71 |
| статья | 0.67 | 0.52 | 0.60 | 0.60 |
| сумма выплаты | 0.72 | 0.56 | 0.65 | 0.77 |
| судья | 0.94 | 0.67 | 0.91 | 0.82 |
| номер документа | 0.96 | 0.86 | 0.91 | 0.75 |
| ответчик | 0.63 | 0.64 | 0.71 | 0.56 |
| дата суда | 0.89 | 0.75 | 0.96 | 0.74 |
| суд | 0.89 | 0.75 | 0.96 | 0.75 |
| решение суда | 0.76 | 0.30 | 0.79 | 0.74 |
| срок обжалования | 0.89 | 0.87 | 0.95 | 0.83 |
| F1 среднее | 0.85 | 0.67 | 0.85 | 0.66 |
Заметим, что комбинация BiLSTM и CRF в общем в общем дает результат лучше, чем LSTM и CRF, а bert embedding уступает методу fasttext. Лучший результат продемонстрировала комбинация BiLSTM и CRF с использованием fasttext, морфологических признаков и регулярных выражений. При сохранении структуры по странице и удалении стоп-слов усредненное значение F-меры равно 0.85. Заметим, что для модели CRF среднее значение такое же, однако для некоторых сущностей лучшего результата можно добиться с помощью рекуррентных нейронных сетей.
Список литературы