ИНФОРМАТИКА И КИБЕРНЕТИКА
№ 4 (22), 2020, Донецк, ДонНТУ
21
УДК 004.048, 004.912

Обобщенная модифицированная модель представления текстовых информационных ресурсов

Н.К. Андриевская
Донецкий национальный технический университет
nataandr@yandex.ru
Аннотация

Данная статья посвящена разработке новых эффективных подходов к формированию представлений текстовой информации при реализации задач информационного поиска в различных информационных системах (ИС). Общей проблемой является разреженность и большие объёмы входных данных, что приводит к необходимости уменьшить вычислительную сложность и повысить производительность методов основных процедур обработки данных. Для решения проблемы авторами предлагается использовать обобщенную модифицированную модель представления текста, а также предварительно выполнить редукцию по тематическим векторам, что одновременно уменьшает размерность и увеличивает семантику представления текста. Кроме этого, для усиления семантики предлагается использовать предметную онтологию системы. Это дает возможность многократно использовать ранее обработанные документы в структурированном виде и использовать уже существующие контекстные вектора в процедурах обработки.

Ключевые слова: векторная модель, сингулярное разложение, факторизация, модель bag-of-words, модель bag-of-concepts, LSA, NMF, семантические связи, RDF-граф, тензор, онтология.

1. Введение

В последнее время все более возрастает интерес к системам и методам извлечения знаний для использования в самых различных сферах при решении конкретных практических задач. Переход на электронный документооборот, активное использование в профессиональной деятельности веб-ресурсов специалистами различного профиля, привело к резкому росту объёма информационных ресурсов (ИР) различного вида, в том числе и неструктурированных. Обмен информацией в ИС происходит преимущественно с помощью текстовых документов, текстовых сообщений и данных. Поэтому не случайно, что весьма значительную долю ИР современных ИС составляет информация текстового вида. Слабая структурированность информационных фондов осложняет управление информацией и работу пользователей с ней. В связи с этим созданию эффективных технологий хранения, обработки и поиска текстовой информации уделяется большое внимание.

Определенным образом это относится и к потокам информации, с которыми встречаются сотрудники вузов и других научных и научно-образовательных организаций. Развитие систем информационного поиска стимулировалось в значительной мере потребностями информационной поддержки научных исследований и образования, разработками автоматизированных библиотечных систем, систем управления знаниями, которые все активнее используются в различных сферах деятельности.

К примеру, в статье [1] была представлена функциональная структура и архитектура системы управления профессиональными знаниями сотрудников вуза для информационной поддержки преподавательской и исследовательской работы. В работе [2] был предложен базирующийся на онтологии подход к структуре такой системы, обеспечивающий представление и интерпретацию информации в виде знаний. При создании системы управления информационными ресурсами научно-образовательных организаций (СУИР) одним из основных модулей был описан блок приобретения знаний. В связи с этим, актуальной становится задача поиска интересующих пользователя ИР как среди огромного количества информации в сети Интернет, так по хранилищу коллекции документов. Формирование представлений ИР требует решения не только при поиске, но и в задачах автоматического аннотирования документа, индексации ИР, а также тематической рубрикации ИР.

2. Постановка проблемы

Для определения семантического соответствия необходимо, чтобы семантические значения запроса и документа были известны. Определение семантических связей можно выполнить разными способами. Одни из них основаны на анализе текста и методах обработки естественного языка, другие используют различные методы индексации векторного пространства и словари типа WordNet [3], третьи используют явно определенную семантику различных онтологических ресурсов, в том числе и полновесные онтологии предметных областей.

В случае неструктурированных документов необходимы передовые методики работы с онтологиями для выделения их семантик и их использования для выявления зависимых документов. Общая производительность ИС в данном случае будет сильно зависеть от качества ранее разработанной онтологической модели и от качества наполнения онтологии экземплярами. Для СУИР была разработана базовая онтологическая модель, которая при онтологическом подходе к проектированию системы является «ядром системы» [4]. Онтология системы используется каждым разработанным модулем системы, особенно на этапах поиска [5] и извлечения информации.

Подведя итог, обобщим некоторыми требования, которые следует учитывать при разработке модели представления текста:

Таким образом, необходимо разработать такую эффективную модель представления текста, основанную на использовании онтологических ресурсов СУИР и традиционных моделей представления текста, которая обеспечивала бы экономию вычислительных мощностей системы.

3. Обзор моделей представления текста

В системах информационного поиска используются различные подходы к построению представлений хранимых документов. От характера используемых представлений документа существенно зависит качество поиска, в том числе точность, полнота, производительность и другие характеристики.

Модель представления текста – это формализованная математическая структура, построенная по неструктурированному тексту. Существуют следующие модели: векторная, языковая, модель скрытых тематик и др. В настоящее время наиболее часто используются векторная модель и модель на основе латентных семантик, а также их модификации.

В векторной модели Vector Space model (VSM) каждый терм представляет собой вектор в пространстве слов [6]. Суть метода отображения текста в вектор заключается в том, что каждому слову соответствует определенная координата в пространстве признаков или вес в соответствии с выбранной весовой функцией.

Для полного определения векторной модели текста необходимо выбрать саму весовую функцию. Главным образом, оценочные весовые функции строятся на частотных и вероятностных характеристиках текста, а также на дистрибутивной семантике.

Среди частотных методов используются следующие функции взвешивания:

Существуют и другие весовые функции, например, логарифмическая, скорректированных весов Гаусса, вероятностная, которая основана на понятии условной вероятности и теория Байеса, а на моделях дистрибутивной семантики, например, word2vec [8].

Кроме всего, Vector Space model (VSM) модель имеет ряд расширений, среди которых наиболее известна Bag-of-Words (BOW). В модели BOW текст представляет собой набор неупорядоченных и несвязанных слов. Считается, что тексты, не имеющих общих слов или имеющих их небольшое количество, являются неблизкими по смыслу (семантически и тематически), что в целом неверно.

Для определения подобия между двумя документами используются различные меры сходства между двумя векторами, определяющими эти документы. Наиболее часто рассчитывают меру косинусной меры близости на основе скалярного произведения векторов, позволяющей провести оценку смысловой близости.

Достоинствами базовой векторной модели BOW является простота, возможность использования операций линейной алгебры для определения сходства между текстами и при ранжировании слов в поисковых запросах. Недостатками является низкая степень сходства для более длинных текстов, отсутствует учет синонимии и полисемии. Главный недостаток заключается в том, что множество слов проецируется в пространство высокой размерности и разреженности и появляется эффект так называемого «проклятия размерности», когда сложность вычислений растет экспоненциально из-за увеличения размерности данных.

На преодоление этих моментов проводится много исследований и написано немало работ. Вариант решения проблемы многим авторам видится в необходимости перехода от традиционного представления текста в разреженном пространстве к новым, семантическим пространствам. Среди широко известных рассмотрим три подхода: на базе концептов, на базе контекстных векторов, на базе латентных семантических связей [9].

Модель bag of concepts (ВОС) построена на основе BOW, позволяет учитывать скрытые смысловые связи. Концептами будем считать наборы синонимичных и семантически связанных слов с одинаковыми и похожими смыслами. Каждый концепт представляется не только с помощью определяющих его слов, но и с помощью контекстного вектора, содержащего веса слов в концепте.

Укрупненный алгоритм формирования контекстного вектора D(k) следующий:

  1. Из модуля извлечения информации передаются все необходимые данные после автоматического разбора текста.
  2. Формируется вектор из ключевых слов, извлеченных с помощью частотного анализа.
  3. Вектор дополняется термами из онтологии.
  4. Поисковый запрос расширяется терминами со сторонних ресурсов (WordNet, Wiktionary) [10].
  5. В случае необходимости корректируется экспертом или автором ресурса полученный вектор.
  6. Для каждого термина вычисляется TF (term frequency).
  7. Элементы вектора сортируются в зависимости от значения TF.
  8. Вектор ограничивается по количеству элементов k (параметр k можно изменять).
  9. Полученный контекстный вектор сохраняется в онтологии в дальнейшем является векторным представлением документа.
  10. Попутно наполняется онтология новыми терминами из массива ключевых слов.

Для получения набора концептов, близких к данному тексту, достаточно иметь вектор концепта и вектор текста, содержащий веса этих же слов в тексте. Два вектора сравниваются по какой-либо мере семантической близости и отбираются несколько наиболее близких, которые и образуют после сортировки вектор, представляющий текст в новом пространстве.

В качестве оператора перехода из одного пространства дескрипторов в другое используется матрица семантических связей «термина-на-термины» размерности kxk, состоящая из контекстных векторов k-мерного пространства.

Пусть текст представлен вектором D(k). Матрица семантических связей R (k, k) позволяет отобразить D(k) - исходное представление текста, в новое представление S(k), уже отражающие семантические связи между словами. Математически модель можно представить в виде выражения:

Sk = Dk * Rkk (1)

В отличие от модели ВОС, модель «контекстных векторов» учитывает зависимости между всеми словами текста, а не только концептами и формирует контекстные вектора по всем словам документа.

Среди моделей также интересным представляется подход на базе латентно-семантического анализа (LSA/LSI). Каждый набор документов (коллекция) имеет неявную, латентную семантическую структуру, представляющую собой объединение отдельных терминов документов. В результате количественного анализа латентных факторов можно получить новое семантическое представление нового документа, в результате которого веса терминов могут быть скорректированы, и поисковый образ документа станет более адекватным его содержанию.

Рассмотрим модель LSA/LSI подробнее. Формирование представлений осуществляется путем факторизации матрицы «Документы-термины» [11]. Существуют несколько способов определения тематик, например, LSA/LSI использует сингулярное разложение (SVD) в качестве факторизации (см. рис. 1).

SVD разложение для LSA/LSI
Рисунок 1 – SVD разложение для LSA/LSI

Извлечение скрытых тематик также можно произвести на основе метода неотрицательной матричной факторизации (NMF), который вместо SVD использует разложение на две матрицы (см. рис. 2) [12].

Метод NMF
Рисунок 2 – Метод NMF

Главным недостатком всех моделей на базе BOW является огромная разреженность данных и отсутствие семантики. Для устранения этих недостатков модель BOW часто комбинируется с другими моделями.

В данной работе для повышения эффективности обработки данных и преодоления ограничений модели Bag-of-words, предлагается модифицировать модель Bag-of-words, комбинируя модели Bag-of-concepts и модель контекстных векторов, а также предметную онтологию.

4. Разработка модифицированной модели представления текста

Для представления многомерных семантических данных мы использовали формализм RDF семантической сети, где отношения моделируются как тройки (субъект, предикат, объект) и где предикат либо определяет отношения между двумя сущностями, либо отношения между сущностью и значением атрибута [13]. Трехмерный тензор является удобной структурой представления многомерных семантических данных (см. рис. 3) [14,15].

Тензорное представление RDF-графа знаний
Рисунок 3 – Тензорное представление RDF-графа знаний

При этом понятия "объект" и "субъект" могут быть заменены понятием "концепт" или "термин". При формировании тензора семантической близости для разных типов связей меры семантической близости были рассчитаны по-разному. Среди мер были как меры, вычисляемые по онтологии (таксономические и атрибутные), так и меры, вычисляемые по векторной модели представления текста.

Работа с тензорами не вызывает особых затруднений. Тензорная алгебра представлена большим количеством различных операций для работы с тензорами, среди которых выделим сложение, вычитание, свертка, тензорное произведение и тензорное разложение различных видов [16].

Существует и достаточное количество инструментальных средств и библиотек, предназначенных для работы с тензорной алгеброй, в том числе и для Python [17].

Поскольку вместо матрицы семантических связей «термина-на-термины» размерности kxk, состоящей из контекстных векторов k-мерного пространства мы используем трехмерное представление в виде семантического тензора «концепт-концепт-предикат» размерности kxkxp, то необходимо модифицировать стандартную модель Bag-of-concepts, обобщив ее для использования в пространствах третьего порядка.

В качестве оператора перехода из одного пространства дескрипторов в другое используется 3-х мерный тензор семантических связей Тркк.

Тензорное представление графа знаний позволяет эффективным образом вычислить обобщенную оценку семантической близости между объектами через факторизацию срезов тензора. Выполним аддитивную свертку тензора Тркк с вектором коэффициентов значимости каждого типа отношения:

Rкк = ∑р=1n Wр * Тркк (2)

где:
Тркк – тензор семантических связей;
Wр - вес, который определяет относительную важность каждого типа отношения;
n- число отношений;
k- число концептов;
Rкк - обобщенная матрица семантических связей концептов.

Таким образом, получаем значение обобщенной семантической матрицы путем аддитивной свертки семантического тензора по третьему измерению(р).

Пусть текст представлен ковариантным тензором первого ранга Dk. Матрица семантических связей позволяет отобразить Dk - исходное представление текста, в новое представление контравариантного тензора первого ранга Sk, уже отражающее семантические связи между словами. Применим формулу 1.

Математически модель получения векторного семантически обогащенного представления можно представить в виде выражения:

Sk = Dk * Rкк (3)

Но проблему большой вычислительной сложности это не устранило, так как в больших онтологиях количество концептов чрезвычайно велико и загрузить в память исходный тензор для выполнения дальнейших операций будет проблематично.

Чтобы справиться с большим количеством RDF-троек, а также с разреженностью данных, необходимо использовать технику редукции признакового пространства, т.е. переход к пространствам более низких порядков.

5. Редукция признакового пространства

Так как многие алгоритмы поиска и классификации информации чрезвычайно чувствительны ко времени вычисления, то проблеме уменьшения размерности пространства и получения качественной онтологической модели уделялось внимание еще на этапе извлечения знаний с помощью модуля автоматического разбора текста.

Для снижения размерности были использованы следующие алгоритмы:

  1. Удалены все ненужные для анализа символы (пунктуационные знаки, цифры, т.д.).
  2. Выполнялась токенизация (текст разбивался по пробелам для получения слов по отдельности).
  3. Удалялись стоп-слова (междометия, союзы, вводные слова и т.д.).
  4. Проверялась орфография (если возможно, исправлялась ошибка).
  5. Проверялась часть речи слова (отбирались только существительные).
  6. Все остальные слова приводились к единой форме (лемме).

Но эти меры не привели к ощутимым результатам. Поэтому актуальной является задача оптимизации признакового пространства, которая состоит в том, чтобы представить исходную информацию, заданную в виде большого количества признаковых описаний, в пространстве меньшей размерности, и, по возможности, минимизировать потери информации.

Данные в системе управления информационными ресурсами научно-образовательных организаций имеют вполне "разумную" размерность (1000-2000 текстовых документов). Несмотря на незначительное количество документов, размерность матрицы, полученной после векторизации текстов, может быть довольно значительной для хранения её в памяти ЭВМ (7000-50000 индексированных термов). Следует предусмотреть и увеличение размерности задачи хотя бы до 5000 документов.

Снижение размерности следует проводить до размерности, позволяющей осуществлять обработку без существенного ухудшения качества поиска.

Стандартные подходы снижения размерности исходного признакового пространства могут быть разделены на два больших класса:

PCA (анализ главных компонент) – один из самых популярных методов сокращения размерности. Однако признаки PCA трудно интерпретировать и метод PCA непредсказуем в выборе координат объектов в новом пространстве.

Для уменьшения размерности также часто применяется сингулярное матричное разложение SVD и неотрицательное матричное разложение. NMF предусматривает разложение в произведение матриц меньшего размера, но при этом элементы U и V неотрицательны. Результат – признаки, которые лучше интерпретируются и могут иметь больше смысла по сравнению с SVD. Проблема самих методов SVD и NMF заключается в том, что это очень медленные и ресурсоемкие алгоритмы. Среди подходов с уменьшением признаков без трансформации пространства весьма перспективным представляется использование тематических разделов и контекстных векторов онтологии для решения задачи снижения размерности.

5.1 Тематическая редукция на базе предметной онтологии системы

Часть проблем, связанных с производительностью и ресурсоемкостью системы, решается с помощью эффективно полученных представлений. В этом случае в процессе обработки мы работаем не с самими, иногда очень объёмными ИР, а с их структурированными представлениями, сохраненными в онтологии. Поскольку при создании СУИР был разработан целый блок для автоматического разбора и структурирования документов (см. рис. 4), а также блок для работы с онтологиями, то мы можем в полном объёме воспользоваться преимуществами уже структурированного представления документов для разработки эффективных моделей представления ИР текстового вида [18].

Укрупненная структура СУИР
Рисунок 4 – Укрупненная структура СУИР

Использование ранее сохраненного представления документа вместо непосредственно самого документа позволяет избежать трудоемких процессов просмотра и анализа полного его содержания при каждой операции с ИР.

Пусть пользователь сформулировал некоторый запрос Q={q1, q2, .. qк}. Семантический образ тематического раздела формируется на базе семантических образов отдельных концептов, принадлежащих данному разделу, и, соответственно, представляет собой частоты слов TF в ИР.

Тензор 2-ранга Ztk задает соответствие между концептами, являющимися ключевыми словами и темами. Редукцию будем выполнять по тематике из тензора Ztk, наиболее соответствующей пользовательскому запросу Qk.

Для определения подходящей тематики, сначала выполним аддитивную свертку тензора Ztk с тензором первого ранга поискового запроса Qk. Тема с максимальным значением веса из вектора Gt и будет наиболее подходящей, чтобы участвовать в редукции.

Gt ≅ Ztk * Qk => max (4)

Далее формируем тензор 3-го ранга Tpkk, добавляя в него данные из RDF – хранилища по отношениям, в которые входили ключевые концепты выбранной темы. Таким образом получаем тематически редуцированный тензор, который содержит только семантически важные термины (см. рис. 5).

Тематический редуцированный тензор
Рисунок 5 – Тематический редуцированный тензор

Существенное снижение размерности (до порядка k - размера контекстного вектора) было достигнуто за счет использования обобщенного модифицированного векторного представления документа на базе модели Word-of-Concepts и онтологической модели, а также за счет тематической редукции семантического тензора.

5.2 Редукция методом тензорных разложений

Использование тензоров может представлять структуру данных более естественно, чем матрицы. Например, трехмерный тензор является более удобной структурой представления семантических данных графа знаний, чем матрица.

Факторизация N-мерного тензора генерирует N матриц, состоящих из к - векторов для каждого измерения скрытого семантического пространства, и служит уникальным средством моделирования и выявления взаимосвязей и совместного поведения n переменных в массиве n-мерных данных [19].

Информационное пространство изобилует работами по технологии факторизации, включая латентный семантический анализ (Deerwester et al., 1990), вероятностные варианты LSA (Hofmann, 1999), Анализ основных компонентов и вероятностные и полиномиальные версии PCA (Buntine & Perttu, 2003; Tipping & Bishop, 1999) и совсем недавно неотрицательная матричная факторизация (NMF) (Paatero & Tapper, 1994; Lee & Seung, 1999)[20].

Для редукции признакового пространства семантического тензора будем использовать подход, основанный на тензорной факторизации. Факторизация данных в более низкое размерное пространство вводит компактный базис, который при соответствующей настройке может описать исходные данные в сжатой форме, ввести некоторую невосприимчивость к шуму.

Для случая NMF существует несколько алгоритмов и реализаций, но не существует эффективных реализаций, которые были бы распространены на более общий тензорный случай [21]. В некотором смысле метод неотрицательной факторизации тензоров можно назвать также n-мерным обобщением SVD, так как SVD матричное разложение для тензора второго порядка является частным случаем тензорного разложения [22]. В работе [22] также отмечается, что единого способа обобщения SVD на тензоры 3-го и более порядка не существует.

В работе [23] приведено большое количество типов тензорных разложений - CANDECOMP/PARAFAC, TUCKER, DEDICOM, INDSCAL, PARAFAC2, CANDELINC, PARATUCK2. Наиболее часто используется каноническое разложение (CP) и разложение Такера, а также их вариации.

Декомпозиция Tucker2 [23] тензора третьего порядка устанавливает одну из факторных матриц в качестве единичной матрицы. Аналогично, декомпозиция Tucker1 [23] устанавливает две факторные матрицы в качестве тождественной матрицы.

Очевидно, что существует множество вариантов тензорных разложений, что может привести к путанице в выборе модели для конкретного приложения. На базе разложения Такера описаны различные варианты разложений, в том числе и HOSVD, и представляет собой один из вариантов обобщения SVD. Но мы воспользуемся вариацией разложения Такера и получаем (см. рис. 6):

Хoop ≅ Dpkk * Aok * Aok * E (5)

где:
X(OxOxP) - тензор 3-го ранга, хранящий концепты и связи межу ними;
D(KxKxP) - тензор 3-го ранга, хранящий вектора ключевых слов по темам и связи межу ними;
A(OxK) - тензор 2-го ранга, хранящий вектора ключевых слов каждого концепта;
E - единичный тензор;
О – количество терминов;
P – количество отношений;
K – количество ключевых терминов.

Тензорное разложение Tucker2
Рисунок 6 – Тензорное разложение Tucker2

Поскольку K гораздо меньше по значению, чем O, то тензор D можно рассматривать как сжатую версию Х. Таким образом, мы осуществляем редукцию тензора X, что существенно уменьшает размерность пространства и увеличивает семантику подобно методу сингулярного разложения матриц SVD, используемых в LSA/LSI.

6. Эксперименты

Перед реализацией программных модулей был выполнен ряд экспериментов на прототипах для тестирования основных алгоритмов и моделей. Для тестирования использовался ПК со средними на текущий момент параметрами: Процессор Intel(R) Core(TM) i3-4010U CPU @ 1.70GHz, 1700 МГц, ядер: 4, логических процессоров: 4, оперативная память (RAM) 8,00 ГБ. Прототипы были разработаны в программной среде Python 3.8, на базе нескольких стандартных библиотек. Для проведения экспериментов были использованы собственные ИР - материалы конференций факультета за последние 10 лет в объеме более 1000 документов. С помощью модуля автоматической обработки тексты документов были распарсены, сохранены в онтологии, а также были получены и сохранены векторные представления документов.

Сравнивалась обработка различных моделей BOW: ONTO – тематически редуцированная модель и TEN – обобщенная на трехмерный случай SVD модель на базе факторизации и тензорных разложений. Основные параметры модели опишем в табл. 1.

Пар-рОписание параметров
1oКоличество объектов, извлеченных из RDF- хранилища
2sКоличество субъектов, извлеченных из RDF- хранилища
3pКоличество типов предикатов, извлеченных из RDF- хранилища
4kДлина контекстного вектора
5wКонтекстный вектор
6lСемантическая оценка концепта
7XИсходный тензор модели
8A, B, C, DТензоры, полученные в результате разложения Таккера
Таблица 1 - Параметры и переменные модели

В процессе экспериментов изменялись такие параметры, как количество концептов модели, количество семантических мер модели (пока реализовано 8 мер СБ), размер контекстного вектора (от 0 до 100) с целью оценить, насколько эти параметры влияют на производительность системы.

Результаты эксперимента, как влияют на производительность операции с многомерным тензором были сведены в табл. 2.

рВремя выполнения алгоритмов для о=5000 к=30
Ввод данных TENОбработка данных TEN
10,14560,076
28,4560,876
310,80021,652
410,89721,887
520,89922,09
620,09972,431
720,49912,786
830,3993,876
122,050415,598
Таблица 2 - Результаты экспериментов

Можно сделать вывод, что изменение параметра р от 1 до 8 хотя и замедляет обработку в среднем на два порядка, но не влияет критично на производительность системы в заданных размерах тензора.

Проведем исследования, как влияет количество входных термов, а, следовательно, и размеры исходной матрицы, на скорость выполнения базовых операций: ввода данных и обработки данных (см. табл. 3).

P=8 k=20Время выполнения функциональных блоков алгоритмов
Процедура ввода данныхПроцедура обработки данных
Кол.ONTO T1, sTEN T2, sONTO T3, sTEN T4, s
00,0050,0020,0001000,09495
7500,008990,16790,0000010,01099
15000,012990,619160,0000990,006
22500,023991,565650,0000010,008
30000,026996,277980,0010040,08495
37500,039988,403230,0010040,09495
45000,0359813,13940,0009990,64206
52500,00411,97040,0010000,49979
67500,006Ошибка!0,020998---------
75000,0080,000001
82500,008990,003004
90000,0080,001004
97500,008990,000999
0,1639242,145720,0252061,44169
Таблица 3 - Результаты экспериментов

Как показали результаты анализа процедур ввода, алгоритм на базе модели ONTO за счет предварительно выполненной редукции работает быстро даже при больших размерах входного тензора.

Совсем другая ситуация наблюдается для алгоритма TEN, когда при выполнении операций загрузки с объёмом тензора 6000х6000x8 при тестировании происходит аварийное завершение работы, связанное с переполнением памяти (см. рис. 7).

Время выполнения процедур ввода при увеличении количества терминов
Рисунок 7 – Время выполнения процедур ввода при увеличении количества терминов

Сравним отдельно скорость выполнения процедур ввода данных при использовании моделей TEN и ONTO. При выполнении процедуры ввода для алгоритма TEN среднее время ввода начинает резко увеличиваться, начиная где-то при количестве терминов более 2500 (см. рис. 8).

Время выполнения процедур ввода при увеличении количества терминов
Рисунок 8 – Время выполнения процедур ввода при увеличении количества терминов

Сравним отдельно алгоритмы обработки данных TEN и ONTO по скорости выполнения. Среднее время обработки по алгоритму с использованием модели TEN на несколько порядков больше, чем при использовании модели ONTO, для которой тестирование выполнялось практически мгновенно (см. рис. 9).

Время выполнения процедур обработки при увеличении количества терминов
Рисунок 9 – Время выполнения процедур обработки при увеличении количества терминов

Конечно, при использовании более мощной вычислительной техники результаты будут улучшены, но для большинства организаций этот вариант не является приемлемым из-за удорожания стоимости системы в целом.

7. Выводы

В ходе исследований была разработана обобщенная модифицированная модель на базе известных подходов bag-of-words и bag-of-concepts, улучшенная за счет использования онтологической модели предметной области и техники редукции по тематическим векторам, что одновременно снизило размерность задачи и увеличило семантику.

Исследования показали, что для больших текстовых массивов ИР организаций за счет высокой требовательности к объёмам оперативной памяти не могут быть использованы обобщенные на трехмерный случай модели на базе NMF и SVD в "чистом" виде. Только применение в качестве представлений тематически редуцированных тензоров позволяет значительно сократить затраты памяти и вычислительных ресурсов и обойти сложности обработки исходного тензора.

Полученные результаты подтверждают оправданность применения разработанной модели представления текстовых документов.

8. Литература

1. Андриевская Н.К. Основные принципы и подходы при разработке системы управления профессиональными знаниями ВУЗа / Н.К. Андриевская // Информатика и кибернетика. 2019. № 4 (18), c 49-56.
2. Андриевская Н.К. Онтологический подход в системах обработки данных научных и научно-образовательных организаций / Н.К. Андриевская // Проблемы искусственного интеллекта. 2020. № 1 (16), С. 23-36.
3. WordNet. Лексическая база данных для английского языка. - Режим доступа: https://wordnet.princeton.edu/ (дата обращения 28 декабря 2020).
4. Андриевская Н.К. Разработка прикладной онтологии в системах обработки данных научных и научно-образовательных организаций / Н.К. Андриевская // Вестник Донецкого национального университета. Серия Г: Технические науки. 2020. №3. – С.43-51.
5. Канатуш С. В. Онтологический подход к веб-поиску / С.В. Канатуш, Н.К. Андриевская // Проблемы радиоэлектроники и телекоммуникаций : сб. науч. тр. / под ред. Ю. Б. Гимпилевича. — Москва-Севастополь : Изд-ва : РНТОРЭС им. А.С. Попова, СевГУ, 2020. — № 3. — 247 с., С. 205— ISSN 2658-6347.
6. Melucci, Massimo. (2009). Vector-Space Model. Encyclopedia on Database Systems.
7. TF-IDF [Электронный ресурс]: Википедия. Свободная энциклопедия. – Режим доступа: https://ru.wikipedia.org/wiki/TF-IDF (дата обращения 28 декабря 2020).
8. Word2vec [Электронный ресурс]: Википедия. Свободная энциклопедия. – Режим доступа: https://ru.wikipedia.org/wiki/Word2vec (дата обращения 28 декабря 2020).
9. Нугуманова А.Б. Обогащение модели Bag of words семантическими связями для повышения качества классификации текстов предметной области / А.Б. Нугуманова, И.А. Бессмертный, П. Пецина, Е.М. Байбурин // Программные продукты и системы. 2016. № 2, с. 89-99.
10. Андриевская Н.К. Анализ возможностей использования существующих словарей для пополнения онтологии / Н.К. Андриевская, А.И. Секирин, С.В. Канатуш // Информатика и кибернетика. 2020. №2(20), c13-21.
11. Адамов Б.И. Применение основных матричных разложений в задачах механики и робототехники / Б.И. Адамов, А.Н. Маслов, Н.В. Осадченко. - М.: Издательство МЭИ, 2019. - 84 с.
12. Silva C., Ribeiro B. (2009) Knowledge Extraction with Non-Negative Matrix Factorization for Text Classification. In: Corchado E., Yin H. (eds) Intelligent Data Engineering and Automated Learning - IDEAL 2009. IDEAL 2009. Lecture Notes in Computer Science, vol 5788. Springer, Berlin, Heidelberg. https://doi.org/10.1007/978-3-642-04394-9_37
13. RDF - Semantic Web Standards [Электронный ресурс]: w3.org. – Режим доступа: https://www.w3.org/RDF / (дата обращения 28 декабря 2020).
14. Nickel, M. et al. A review of relational machine learning for knowledge graphs / M. Nickel et al. // Proceedings of the IEEE. – 2015. – Vol.104. No. 1. - P.11-33.
15. Nickel M., Tresp V., Kriegel H. P. A Three-Way Model for Collective Learning on Multi-Relational Data // ICML. 2011. Vol. 11.
16. Вильчевская Е.Н. Тензорная алгебра и тезорный анализ: учеб. пособие / Е.Н. Вильчевская. — СПб. : Изд-во Политехн. ун-та, 2012. 4 c.
17. Kossaifi, Jean; Panagakis, Yannis; Anandkumar, Anima; Pantic, Maja (2019). "TensorLy: Tensor Learning in Python". JMLR. 20 (26): 1–6.
18. Андриевская Н. К. Разработка архитектурной модели системы управления информационными ресурсами организаций / Н.К. Андриевская, А.И Cекирин, О.В. Ченгарь // Программная инженерия: методы и технологии разработки информационно-вычислительных систем (ПИИВС-2020): сборник научных трудов III Международной научно-практической конференции, Том. 1. 25-26 ноября 2020 г. – Донецк, ГОУВПО «Донецкий национальный технический университет», 2020. – 169 с. – С. 46-54.
19. Lathauwer, L& DeMoor, Bart& Vandewalle, Joos. (2000). Multilinear Singular Value Tensor Decompositions.SIAM J.Matrix Anal. Apl.24.
20. Amnon Shashua and Tamir Hazan. 2005. Non-negative tensor factorization with applications to statistics and computer vision. In Proceedings of the 22nd international conference on Machine learning (ICML '05). Association for Computing Machinery, New York, NY, USA, 792–799. DOI:https://doi.org/10.1145/1102351.1102451
21. Department of Computer Science Technical Report TR-2006-21 October 2006, University of British Columbia Computing nonnegative tensor factorizations Michael P. Friedlander∗ Kathrin Hatz† October 19, 2006 for computing the NTF of a dataset.
22. Ma, S., Jiang, B., Huang, X., & Zhang, S. (2016). Tensor models: Solution methods and applications. In S. Cui, A. Hero, III, Z. Luo, & J. Moura (Eds.), Big Data over Networks (pp. 3-36). Cambridge: Cambridge University Press. doi:10.1017/CBO9781316162750.002
23. Kolda Tamara G., Bader Brett W. Tensor Decompositions and Applications // SIAM Rev., 51(3), 455–500.

Статья поступила в редакцию 05.12.2020
Рекомендована к публикации профессором Павлышом В. Н