1. Введение
В последнее время все более возрастает интерес к системам и методам извлечения знаний для использования в самых различных сферах при решении конкретных практических задач. Переход на электронный документооборот, активное использование в профессиональной деятельности веб-ресурсов специалистами различного профиля, привело к резкому росту объёма информационных ресурсов (ИР) различного вида, в том числе и неструктурированных. Обмен информацией в ИС происходит преимущественно с помощью текстовых документов, текстовых сообщений и данных. Поэтому не случайно, что весьма значительную долю ИР современных ИС составляет информация текстового вида. Слабая структурированность информационных фондов осложняет управление информацией и работу пользователей с ней. В связи с этим созданию эффективных технологий хранения, обработки и поиска текстовой информации уделяется большое внимание.
Определенным образом это относится и к потокам информации, с которыми встречаются сотрудники вузов и других научных и научно-образовательных организаций. Развитие систем информационного поиска стимулировалось в значительной мере потребностями информационной поддержки научных исследований и образования, разработками автоматизированных библиотечных систем, систем управления знаниями, которые все активнее используются в различных сферах деятельности.
К примеру, в статье [1] была представлена функциональная структура и архитектура системы управления профессиональными знаниями сотрудников вуза для информационной поддержки преподавательской и исследовательской работы. В работе [2] был предложен базирующийся на онтологии подход к структуре такой системы, обеспечивающий представление и интерпретацию информации в виде знаний. При создании системы управления информационными ресурсами научно-образовательных организаций (СУИР) одним из основных модулей был описан блок приобретения знаний. В связи с этим, актуальной становится задача поиска интересующих пользователя ИР как среди огромного количества информации в сети Интернет, так по хранилищу коллекции документов. Формирование представлений ИР требует решения не только при поиске, но и в задачах автоматического аннотирования документа, индексации ИР, а также тематической рубрикации ИР.
2. Постановка проблемы
Для определения семантического соответствия необходимо, чтобы семантические значения запроса и документа были известны. Определение семантических связей можно выполнить разными способами. Одни из них основаны на анализе текста и методах обработки естественного языка, другие используют различные методы индексации векторного пространства и словари типа WordNet [3], третьи используют явно определенную семантику различных онтологических ресурсов, в том числе и полновесные онтологии предметных областей.
В случае неструктурированных документов необходимы передовые методики работы с онтологиями для выделения их семантик и их использования для выявления зависимых документов. Общая производительность ИС в данном случае будет сильно зависеть от качества ранее разработанной онтологической модели и от качества наполнения онтологии экземплярами. Для СУИР была разработана базовая онтологическая модель, которая при онтологическом подходе к проектированию системы является «ядром системы» [4]. Онтология системы используется каждым разработанным модулем системы, особенно на этапах поиска [5] и извлечения информации.
Подведя итог, обобщим некоторыми требования, которые следует учитывать при разработке модели представления текста:
- так как информационные ресурсы в большинстве случаев редко изменяются, тем более значительным образом, построение представления каждого имеющегося в системе документа необходимо осуществлять однократно на этапе его ввода (импорта) в систему;
- так как ИР могут быть значительных объёмов, а коллекции документов, хранимых в системе, могут быть довольно большого размера, то возникает проблема производительности, в некоторых случаях даже критичная, что следует учитывать при разработке алгоритмов;
- следует избегать методов, обладающих большой вычислительной сложностью;
- необходимо использовать все достоинства онтологического подхода.
Таким образом, необходимо разработать такую эффективную модель представления текста, основанную на использовании онтологических ресурсов СУИР и традиционных моделей представления текста, которая обеспечивала бы экономию вычислительных мощностей системы.
3. Обзор моделей представления текста
В системах информационного поиска используются различные подходы к построению представлений хранимых документов. От характера используемых представлений документа существенно зависит качество поиска, в том числе точность, полнота, производительность и другие характеристики.
Модель представления текста – это формализованная математическая структура, построенная по неструктурированному тексту. Существуют следующие модели: векторная, языковая, модель скрытых тематик и др. В настоящее время наиболее часто используются векторная модель и модель на основе латентных семантик, а также их модификации.
В векторной модели Vector Space model (VSM) каждый терм представляет собой вектор в пространстве слов [6]. Суть метода отображения текста в вектор заключается в том, что каждому слову соответствует определенная координата в пространстве признаков или вес в соответствии с выбранной весовой функцией.
Для полного определения векторной модели текста необходимо выбрать саму весовую функцию. Главным образом, оценочные весовые функции строятся на частотных и вероятностных характеристиках текста, а также на дистрибутивной семантике.
Среди частотных методов используются следующие функции взвешивания:
- двоичные — вес равен 1, если терм встречается в документе и 0 если не встречается;
- TF (term frequency) — функция веса вычисляется от количества вхождений терма в документе [7];
- TF-IDF (term frequency — inverse document frequency) — функция веса вычисляется как произведение функции TF и функции IDF, благодаря которой можно снизить весомость наиболее широко используемых слов (предлогов, союзов, общих терминов и понятий) [7].
Существуют и другие весовые функции, например, логарифмическая, скорректированных весов Гаусса, вероятностная, которая основана на понятии условной вероятности и теория Байеса, а на моделях дистрибутивной семантики, например, word2vec [8].
Кроме всего, Vector Space model (VSM) модель имеет ряд расширений, среди которых наиболее известна Bag-of-Words (BOW). В модели BOW текст представляет собой набор неупорядоченных и несвязанных слов. Считается, что тексты, не имеющих общих слов или имеющих их небольшое количество, являются неблизкими по смыслу (семантически и тематически), что в целом неверно.
Для определения подобия между двумя документами используются различные меры сходства между двумя векторами, определяющими эти документы. Наиболее часто рассчитывают меру косинусной меры близости на основе скалярного произведения векторов, позволяющей провести оценку смысловой близости.
Достоинствами базовой векторной модели BOW является простота, возможность использования операций линейной алгебры для определения сходства между текстами и при ранжировании слов в поисковых запросах. Недостатками является низкая степень сходства для более длинных текстов, отсутствует учет синонимии и полисемии. Главный недостаток заключается в том, что множество слов проецируется в пространство высокой размерности и разреженности и появляется эффект так называемого «проклятия размерности», когда сложность вычислений растет экспоненциально из-за увеличения размерности данных.
На преодоление этих моментов проводится много исследований и написано немало работ. Вариант решения проблемы многим авторам видится в необходимости перехода от традиционного представления текста в разреженном пространстве к новым, семантическим пространствам. Среди широко известных рассмотрим три подхода: на базе концептов, на базе контекстных векторов, на базе латентных семантических связей [9].
Модель bag of concepts (ВОС) построена на основе BOW, позволяет учитывать скрытые смысловые связи. Концептами будем считать наборы синонимичных и семантически связанных слов с одинаковыми и похожими смыслами. Каждый концепт представляется не только с помощью определяющих его слов, но и с помощью контекстного вектора, содержащего веса слов в концепте.
Укрупненный алгоритм формирования контекстного вектора D(k) следующий:
- Из модуля извлечения информации передаются все необходимые данные после автоматического разбора текста.
- Формируется вектор из ключевых слов, извлеченных с помощью частотного анализа.
- Вектор дополняется термами из онтологии.
- Поисковый запрос расширяется терминами со сторонних ресурсов (WordNet, Wiktionary) [10].
- В случае необходимости корректируется экспертом или автором ресурса полученный вектор.
- Для каждого термина вычисляется TF (term frequency).
- Элементы вектора сортируются в зависимости от значения TF.
- Вектор ограничивается по количеству элементов k (параметр k можно изменять).
- Полученный контекстный вектор сохраняется в онтологии в дальнейшем является векторным представлением документа.
- Попутно наполняется онтология новыми терминами из массива ключевых слов.
Для получения набора концептов, близких к данному тексту, достаточно иметь вектор концепта и вектор текста, содержащий веса этих же слов в тексте. Два вектора сравниваются по какой-либо мере семантической близости и отбираются несколько наиболее близких, которые и образуют после сортировки вектор, представляющий текст в новом пространстве.
В качестве оператора перехода из одного пространства дескрипторов в другое используется матрица семантических связей «термина-на-термины» размерности kxk, состоящая из контекстных векторов k-мерного пространства.
Пусть текст представлен вектором D(k). Матрица семантических связей R (k, k) позволяет отобразить D(k) - исходное представление текста, в новое представление S(k), уже отражающие семантические связи между словами. Математически модель можно представить в виде выражения:
В отличие от модели ВОС, модель «контекстных векторов» учитывает зависимости между всеми словами текста, а не только концептами и формирует контекстные вектора по всем словам документа.
Среди моделей также интересным представляется подход на базе латентно-семантического анализа (LSA/LSI). Каждый набор документов (коллекция) имеет неявную, латентную семантическую структуру, представляющую собой объединение отдельных терминов документов. В результате количественного анализа латентных факторов можно получить новое семантическое представление нового документа, в результате которого веса терминов могут быть скорректированы, и поисковый образ документа станет более адекватным его содержанию.
Рассмотрим модель LSA/LSI подробнее. Формирование представлений осуществляется путем факторизации матрицы «Документы-термины» [11]. Существуют несколько способов определения тематик, например, LSA/LSI использует сингулярное разложение (SVD) в качестве факторизации (см. рис. 1).

Извлечение скрытых тематик также можно произвести на основе метода неотрицательной матричной факторизации (NMF), который вместо SVD использует разложение на две матрицы (см. рис. 2) [12].

Главным недостатком всех моделей на базе BOW является огромная разреженность данных и отсутствие семантики. Для устранения этих недостатков модель BOW часто комбинируется с другими моделями.
В данной работе для повышения эффективности обработки данных и преодоления ограничений модели Bag-of-words, предлагается модифицировать модель Bag-of-words, комбинируя модели Bag-of-concepts и модель контекстных векторов, а также предметную онтологию.
4. Разработка модифицированной модели представления текста
Для представления многомерных семантических данных мы использовали формализм RDF семантической сети, где отношения моделируются как тройки (субъект, предикат, объект) и где предикат либо определяет отношения между двумя сущностями, либо отношения между сущностью и значением атрибута [13]. Трехмерный тензор является удобной структурой представления многомерных семантических данных (см. рис. 3) [14,15].

При этом понятия "объект" и "субъект" могут быть заменены понятием "концепт" или "термин". При формировании тензора семантической близости для разных типов связей меры семантической близости были рассчитаны по-разному. Среди мер были как меры, вычисляемые по онтологии (таксономические и атрибутные), так и меры, вычисляемые по векторной модели представления текста.
Работа с тензорами не вызывает особых затруднений. Тензорная алгебра представлена большим количеством различных операций для работы с тензорами, среди которых выделим сложение, вычитание, свертка, тензорное произведение и тензорное разложение различных видов [16].
Существует и достаточное количество инструментальных средств и библиотек, предназначенных для работы с тензорной алгеброй, в том числе и для Python [17].
Поскольку вместо матрицы семантических связей «термина-на-термины» размерности kxk, состоящей из контекстных векторов k-мерного пространства мы используем трехмерное представление в виде семантического тензора «концепт-концепт-предикат» размерности kxkxp, то необходимо модифицировать стандартную модель Bag-of-concepts, обобщив ее для использования в пространствах третьего порядка.
В качестве оператора перехода из одного пространства дескрипторов в другое используется 3-х мерный тензор семантических связей Тркк.
Тензорное представление графа знаний позволяет эффективным образом вычислить обобщенную оценку семантической близости между объектами через факторизацию срезов тензора. Выполним аддитивную свертку тензора Тркк с вектором коэффициентов значимости каждого типа отношения:
где:
Тркк – тензор семантических связей;
Wр - вес, который определяет относительную важность каждого типа отношения;
n- число отношений;
k- число концептов;
Rкк - обобщенная матрица семантических связей концептов.
Таким образом, получаем значение обобщенной семантической матрицы путем аддитивной свертки семантического тензора по третьему измерению(р).
Пусть текст представлен ковариантным тензором первого ранга Dk. Матрица семантических связей позволяет отобразить Dk - исходное представление текста, в новое представление контравариантного тензора первого ранга Sk, уже отражающее семантические связи между словами. Применим формулу 1.
Математически модель получения векторного семантически обогащенного представления можно представить в виде выражения:
Но проблему большой вычислительной сложности это не устранило, так как в больших онтологиях количество концептов чрезвычайно велико и загрузить в память исходный тензор для выполнения дальнейших операций будет проблематично.
Чтобы справиться с большим количеством RDF-троек, а также с разреженностью данных, необходимо использовать технику редукции признакового пространства, т.е. переход к пространствам более низких порядков.
5. Редукция признакового пространства
Так как многие алгоритмы поиска и классификации информации чрезвычайно чувствительны ко времени вычисления, то проблеме уменьшения размерности пространства и получения качественной онтологической модели уделялось внимание еще на этапе извлечения знаний с помощью модуля автоматического разбора текста.
Для снижения размерности были использованы следующие алгоритмы:
- Удалены все ненужные для анализа символы (пунктуационные знаки, цифры, т.д.).
- Выполнялась токенизация (текст разбивался по пробелам для получения слов по отдельности).
- Удалялись стоп-слова (междометия, союзы, вводные слова и т.д.).
- Проверялась орфография (если возможно, исправлялась ошибка).
- Проверялась часть речи слова (отбирались только существительные).
- Все остальные слова приводились к единой форме (лемме).
Но эти меры не привели к ощутимым результатам. Поэтому актуальной является задача оптимизации признакового пространства, которая состоит в том, чтобы представить исходную информацию, заданную в виде большого количества признаковых описаний, в пространстве меньшей размерности, и, по возможности, минимизировать потери информации.
Данные в системе управления информационными ресурсами научно-образовательных организаций имеют вполне "разумную" размерность (1000-2000 текстовых документов). Несмотря на незначительное количество документов, размерность матрицы, полученной после векторизации текстов, может быть довольно значительной для хранения её в памяти ЭВМ (7000-50000 индексированных термов). Следует предусмотреть и увеличение размерности задачи хотя бы до 5000 документов.
Снижение размерности следует проводить до размерности, позволяющей осуществлять обработку без существенного ухудшения качества поиска.
Стандартные подходы снижения размерности исходного признакового пространства могут быть разделены на два больших класса:
- с трансформацией признакового пространства (PCA, SVD, NMF);
- без трансформации исходного пространства с исключением неинформативных признаков.
PCA (анализ главных компонент) – один из самых популярных методов сокращения размерности. Однако признаки PCA трудно интерпретировать и метод PCA непредсказуем в выборе координат объектов в новом пространстве.
Для уменьшения размерности также часто применяется сингулярное матричное разложение SVD и неотрицательное матричное разложение. NMF предусматривает разложение в произведение матриц меньшего размера, но при этом элементы U и V неотрицательны. Результат – признаки, которые лучше интерпретируются и могут иметь больше смысла по сравнению с SVD. Проблема самих методов SVD и NMF заключается в том, что это очень медленные и ресурсоемкие алгоритмы. Среди подходов с уменьшением признаков без трансформации пространства весьма перспективным представляется использование тематических разделов и контекстных векторов онтологии для решения задачи снижения размерности.
5.1 Тематическая редукция на базе предметной онтологии системы
Часть проблем, связанных с производительностью и ресурсоемкостью системы, решается с помощью эффективно полученных представлений. В этом случае в процессе обработки мы работаем не с самими, иногда очень объёмными ИР, а с их структурированными представлениями, сохраненными в онтологии. Поскольку при создании СУИР был разработан целый блок для автоматического разбора и структурирования документов (см. рис. 4), а также блок для работы с онтологиями, то мы можем в полном объёме воспользоваться преимуществами уже структурированного представления документов для разработки эффективных моделей представления ИР текстового вида [18].

Использование ранее сохраненного представления документа вместо непосредственно самого документа позволяет избежать трудоемких процессов просмотра и анализа полного его содержания при каждой операции с ИР.
Пусть пользователь сформулировал некоторый запрос Q={q1, q2, .. qк}. Семантический образ тематического раздела формируется на базе семантических образов отдельных концептов, принадлежащих данному разделу, и, соответственно, представляет собой частоты слов TF в ИР.
Тензор 2-ранга Ztk задает соответствие между концептами, являющимися ключевыми словами и темами. Редукцию будем выполнять по тематике из тензора Ztk, наиболее соответствующей пользовательскому запросу Qk.
Для определения подходящей тематики, сначала выполним аддитивную свертку тензора Ztk с тензором первого ранга поискового запроса Qk. Тема с максимальным значением веса из вектора Gt и будет наиболее подходящей, чтобы участвовать в редукции.
Далее формируем тензор 3-го ранга Tpkk, добавляя в него данные из RDF – хранилища по отношениям, в которые входили ключевые концепты выбранной темы. Таким образом получаем тематически редуцированный тензор, который содержит только семантически важные термины (см. рис. 5).

Существенное снижение размерности (до порядка k - размера контекстного вектора) было достигнуто за счет использования обобщенного модифицированного векторного представления документа на базе модели Word-of-Concepts и онтологической модели, а также за счет тематической редукции семантического тензора.
5.2 Редукция методом тензорных разложений
Использование тензоров может представлять структуру данных более естественно, чем матрицы. Например, трехмерный тензор является более удобной структурой представления семантических данных графа знаний, чем матрица.
Факторизация N-мерного тензора генерирует N матриц, состоящих из к - векторов для каждого измерения скрытого семантического пространства, и служит уникальным средством моделирования и выявления взаимосвязей и совместного поведения n переменных в массиве n-мерных данных [19].
Информационное пространство изобилует работами по технологии факторизации, включая латентный семантический анализ (Deerwester et al., 1990), вероятностные варианты LSA (Hofmann, 1999), Анализ основных компонентов и вероятностные и полиномиальные версии PCA (Buntine & Perttu, 2003; Tipping & Bishop, 1999) и совсем недавно неотрицательная матричная факторизация (NMF) (Paatero & Tapper, 1994; Lee & Seung, 1999)[20].
Для редукции признакового пространства семантического тензора будем использовать подход, основанный на тензорной факторизации. Факторизация данных в более низкое размерное пространство вводит компактный базис, который при соответствующей настройке может описать исходные данные в сжатой форме, ввести некоторую невосприимчивость к шуму.
Для случая NMF существует несколько алгоритмов и реализаций, но не существует эффективных реализаций, которые были бы распространены на более общий тензорный случай [21]. В некотором смысле метод неотрицательной факторизации тензоров можно назвать также n-мерным обобщением SVD, так как SVD матричное разложение для тензора второго порядка является частным случаем тензорного разложения [22]. В работе [22] также отмечается, что единого способа обобщения SVD на тензоры 3-го и более порядка не существует.
В работе [23] приведено большое количество типов тензорных разложений - CANDECOMP/PARAFAC, TUCKER, DEDICOM, INDSCAL, PARAFAC2, CANDELINC, PARATUCK2. Наиболее часто используется каноническое разложение (CP) и разложение Такера, а также их вариации.
Декомпозиция Tucker2 [23] тензора третьего порядка устанавливает одну из факторных матриц в качестве единичной матрицы. Аналогично, декомпозиция Tucker1 [23] устанавливает две факторные матрицы в качестве тождественной матрицы.
Очевидно, что существует множество вариантов тензорных разложений, что может привести к путанице в выборе модели для конкретного приложения. На базе разложения Такера описаны различные варианты разложений, в том числе и HOSVD, и представляет собой один из вариантов обобщения SVD. Но мы воспользуемся вариацией разложения Такера и получаем (см. рис. 6):
где:
X(OxOxP) - тензор 3-го ранга, хранящий концепты и связи межу ними;
D(KxKxP) - тензор 3-го ранга, хранящий вектора ключевых слов по темам и связи межу ними;
A(OxK) - тензор 2-го ранга, хранящий вектора ключевых слов каждого концепта;
E - единичный тензор;
О – количество терминов;
P – количество отношений;
K – количество ключевых терминов.

Поскольку K гораздо меньше по значению, чем O, то тензор D можно рассматривать как сжатую версию Х. Таким образом, мы осуществляем редукцию тензора X, что существенно уменьшает размерность пространства и увеличивает семантику подобно методу сингулярного разложения матриц SVD, используемых в LSA/LSI.
6. Эксперименты
Перед реализацией программных модулей был выполнен ряд экспериментов на прототипах для тестирования основных алгоритмов и моделей. Для тестирования использовался ПК со средними на текущий момент параметрами: Процессор Intel(R) Core(TM) i3-4010U CPU @ 1.70GHz, 1700 МГц, ядер: 4, логических процессоров: 4, оперативная память (RAM) 8,00 ГБ. Прототипы были разработаны в программной среде Python 3.8, на базе нескольких стандартных библиотек. Для проведения экспериментов были использованы собственные ИР - материалы конференций факультета за последние 10 лет в объеме более 1000 документов. С помощью модуля автоматической обработки тексты документов были распарсены, сохранены в онтологии, а также были получены и сохранены векторные представления документов.
Сравнивалась обработка различных моделей BOW: ONTO – тематически редуцированная модель и TEN – обобщенная на трехмерный случай SVD модель на базе факторизации и тензорных разложений. Основные параметры модели опишем в табл. 1.
| № | Пар-р | Описание параметров |
|---|---|---|
| 1 | o | Количество объектов, извлеченных из RDF- хранилища |
| 2 | s | Количество субъектов, извлеченных из RDF- хранилища |
| 3 | p | Количество типов предикатов, извлеченных из RDF- хранилища |
| 4 | k | Длина контекстного вектора |
| 5 | w | Контекстный вектор |
| 6 | l | Семантическая оценка концепта |
| 7 | X | Исходный тензор модели |
| 8 | A, B, C, D | Тензоры, полученные в результате разложения Таккера |
В процессе экспериментов изменялись такие параметры, как количество концептов модели, количество семантических мер модели (пока реализовано 8 мер СБ), размер контекстного вектора (от 0 до 100) с целью оценить, насколько эти параметры влияют на производительность системы.
Результаты эксперимента, как влияют на производительность операции с многомерным тензором были сведены в табл. 2.
| р | Время выполнения алгоритмов для о=5000 к=30 | |
|---|---|---|
| Ввод данных TEN | Обработка данных TEN | |
| 1 | 0,1456 | 0,076 |
| 2 | 8,456 | 0,876 |
| 3 | 10,8002 | 1,652 |
| 4 | 10,8972 | 1,887 |
| 5 | 20,8992 | 2,09 |
| 6 | 20,0997 | 2,431 |
| 7 | 20,4991 | 2,786 |
| 8 | 30,399 | 3,876 |
| ∑ | 122,0504 | 15,598 |
Можно сделать вывод, что изменение параметра р от 1 до 8 хотя и замедляет обработку в среднем на два порядка, но не влияет критично на производительность системы в заданных размерах тензора.
Проведем исследования, как влияет количество входных термов, а, следовательно, и размеры исходной матрицы, на скорость выполнения базовых операций: ввода данных и обработки данных (см. табл. 3).
| P=8 k=20 | Время выполнения функциональных блоков алгоритмов | |||
|---|---|---|---|---|
| Процедура ввода данных | Процедура обработки данных | |||
| Кол. | ONTO T1, s | TEN T2, s | ONTO T3, s | TEN T4, s |
| 0 | 0,005 | 0,002 | 0,000100 | 0,09495 |
| 750 | 0,00899 | 0,1679 | 0,000001 | 0,01099 |
| 1500 | 0,01299 | 0,61916 | 0,000099 | 0,006 |
| 2250 | 0,02399 | 1,56565 | 0,000001 | 0,008 |
| 3000 | 0,02699 | 6,27798 | 0,001004 | 0,08495 |
| 3750 | 0,03998 | 8,40323 | 0,001004 | 0,09495 |
| 4500 | 0,03598 | 13,1394 | 0,000999 | 0,64206 |
| 5250 | 0,004 | 11,9704 | 0,001000 | 0,49979 |
| 6750 | 0,006 | Ошибка! | 0,020998 | --------- |
| 7500 | 0,008 | 0,000001 | ||
| 8250 | 0,00899 | 0,003004 | ||
| 9000 | 0,008 | 0,001004 | ||
| 9750 | 0,00899 | 0,000999 | ||
| ∑ | 0,16392 | 42,14572 | 0,025206 | 1,44169 |
Как показали результаты анализа процедур ввода, алгоритм на базе модели ONTO за счет предварительно выполненной редукции работает быстро даже при больших размерах входного тензора.
Совсем другая ситуация наблюдается для алгоритма TEN, когда при выполнении операций загрузки с объёмом тензора 6000х6000x8 при тестировании происходит аварийное завершение работы, связанное с переполнением памяти (см. рис. 7).

Сравним отдельно скорость выполнения процедур ввода данных при использовании моделей TEN и ONTO. При выполнении процедуры ввода для алгоритма TEN среднее время ввода начинает резко увеличиваться, начиная где-то при количестве терминов более 2500 (см. рис. 8).

Сравним отдельно алгоритмы обработки данных TEN и ONTO по скорости выполнения. Среднее время обработки по алгоритму с использованием модели TEN на несколько порядков больше, чем при использовании модели ONTO, для которой тестирование выполнялось практически мгновенно (см. рис. 9).

Конечно, при использовании более мощной вычислительной техники результаты будут улучшены, но для большинства организаций этот вариант не является приемлемым из-за удорожания стоимости системы в целом.
7. Выводы
В ходе исследований была разработана обобщенная модифицированная модель на базе известных подходов bag-of-words и bag-of-concepts, улучшенная за счет использования онтологической модели предметной области и техники редукции по тематическим векторам, что одновременно снизило размерность задачи и увеличило семантику.
Исследования показали, что для больших текстовых массивов ИР организаций за счет высокой требовательности к объёмам оперативной памяти не могут быть использованы обобщенные на трехмерный случай модели на базе NMF и SVD в "чистом" виде. Только применение в качестве представлений тематически редуцированных тензоров позволяет значительно сократить затраты памяти и вычислительных ресурсов и обойти сложности обработки исходного тензора.
Полученные результаты подтверждают оправданность применения разработанной модели представления текстовых документов.
8. Литература
Статья поступила в редакцию 05.12.2020
Рекомендована к публикации профессором Павлышом В. Н