УДК 004.855.5
Аннотация. Формализован процесс сопоставления текста требований предприятия и рабочей программы дисциплины. Поставленная задача решена путём компьютерной обработки текстов требований предприятий на естественном языке методами машинного обучения. Построен конвейер обработки естественного языка для получения смысловой оценки текста. Исследовано влияние параметров модели на определение схожести текстов по смыслу. Изучено влияния порядка слов в документах на их смысл в реализованной модели. Экспериментальные исследования проведены при помощи разработанной программной реализации. Обосновано применения данного подхода для определения схожести по смыслу текстов требований предприятий и рабочих программ дисциплин.
Ключевые слова: кафедра университета, требования предприятий, рабочие программы дисциплин, определение схожести текстов, машинное обучение.
Введение
В настоящее время одной из важных проблем системы высшего образования в России является несоответствие между компетенциями, получаемыми выпускниками в учебных заведениях, и необходимыми профессиональными умениями для трудоустройства [1],[2]. Таким образом возникает необходимость в регулярной и профессионально-ориентированной кооперации учебных заведений и предприятий для решения данной проблемы [3],[4].
Как известно, уровень профессиональной подготовки выпускников во многом определяется рабочими программами дисциплин (РПД). Содержание РПД инспектирует учебно-методическая комиссия кафедры на предмет их соответствия государственному стандарту по направлению подготовки. Важной функцией учебнометодической комиссии является своевременная актуализация содержания рабочих программ дисциплин, которая должна способствовать подготовке настоящих профессионалов, востребованных на рынке труда. Рабочие программы при актуализации должны периодически обновляться в соответствии с требованиями современной цифровой экономики и согласовываться с работодателями. Учебно-методическая комиссия кафедры анализирует требования работодателей и даёт рекомендации соответствующим лекторам на корректировку рабочих программ, которых они затрагивают. Участники этого процесса (предприятия, методическая комиссия кафедры, лекторы) образуют распределённую систему, для которых характерна территориальная удалённость, автономность и функциональная неоднородность (см. рис. 1). Взаимодействие участников в этой системе осуществляется на уровне смыслового анализа текстовых документов (рекомендации предприятий, рабочие программы дисциплин). Эта задача решается методами обработки естественного языка (NLP), образующих одно из направлений машинного обучения [5].
Автоматизация решения этой задачи является целью данной работы. Функционал системы автоматизации должен реализовывать интеллектуальный анализ требований предприятий и по критерию смысловой близости определять рабочую программу дисциплины. Для достижения поставленной цели выполнена формализация указанной задачи, разработан алгоритм ее решения и проведен ряд экспериментальных исследований.
Постановка задачи
Пусть имеется множество рабочих программ дисциплин 𝑃, где каждый элемент 𝑝 ∈ 𝑃 является текстовым документом, определяющим содержание и структуру учебного процесса по изучению конкретной учебной дисциплины с целью получения профессиональных знаний.
Пусть 𝑅 будет множеством требований от предприятий, где каждый элемент 𝑟 ∈ 𝑅 является также текстовым документом, в котором представлены необходимые для работы предприятия компетенции.
Цель заключается в установлении соотношения между требованиями и рабочей программой дисциплины в виде специальной функции 𝑠𝑖𝑚: 𝑅 → 𝑃, которая каждому требованию 𝑟 ∈ 𝑅 ставит в соответствие наиболее близкую в профессиональном плане рабочую программу дисциплины 𝑝 ∈ 𝑃.
Таким образом, данная задача предполагает для известного множества рабочих программ 𝑃 и предложенного текстового документа с требованиями предприятия 𝑟 ∈ 𝑅 определение наиболее подходящей дисциплины p_sim ∈ P.
Дальнейшей задачей является определение функции 𝑠𝑖𝑚 соотнесения требований предприятия с одной из рабочих программ.
Сопоставление требований и РПД
Определим метрику 𝑀(𝑟, 𝑝), которая для каждого требования 𝑟 ∈ 𝑅 и каждой рабочей программы дисциплины 𝑝 ∈ 𝑃 будет отражать их схожесть по смыслу в виде вещественного числа с областью значений 𝐸(𝑀(𝑟, 𝑝)) = [−1; 1]. Тогда задача соотнесения требований предприятия с рабочей программой будет состоять в том, чтобы найти такую дисциплину 𝑝, для которой значение метрики 𝑀(𝑟, 𝑝) будет максимально, т.е.:
∀ 𝑟 ∈ 𝑅 〈𝑀(𝑟, 𝑠𝑖𝑚(𝑟)) = max 𝑀(𝑟, 𝑝)〉, 𝑝∈𝑃 (1)
Для реализации данной метрики были использованы методы обработки естественного языка (NLP), т.к. они применяются для оценки схожести текстовых документов. С помощью этих методов можно преобразовать тексты в числовое представление, используя модели векторного представления текста. Для вычисления метрики в данном случае достаточно оценить косинусное расстояние между вектором документа требований и рабочей программы дисциплины:
𝑀(𝑟, 𝑝) = 𝑣𝑒𝑐(𝑟) ∗ 𝑣𝑒𝑐(𝑝) / (‖𝑣𝑒𝑐(𝑟)‖ ∗ ‖𝑣𝑒𝑐(𝑝)‖), (2)
где 𝑣𝑒𝑐 − функция преобразования текстового документа в вектор заданной длины.
Для преобразования текстового документа в вектор рассматривались модели, основанные на количественных характеристиках слов в тексте, такие как BOW, TF-IDF, и модели вложений слов, такие как Word2Vec, Doc2Vec, FastText и Glove [5, 6]. Для решения данной задачи была выбрана модель вложений слов Doc2Vec, потому что она позволяет учитывать контекст и смысл слов. Для неё разработан алгоритм, который позволяет создавать векторное представление документа любой длины. Для программной реализации функции 𝑣𝑒𝑐 был построен конвейер NLP (см. рис. 2).
Основными этапами конвейера NLP являются: разделение исходного текста документа на токены с помощью регулярных выражений, фильтрация стоп-слов и слишком коротких или длинных слов, лемматизация, преобразование полученных токенов в семантический вектор текста документа с помощью модели Doc2Vec.
Определение сходства текстов
Программная реализация модели выполнена с помощью языка программирования Python, библиотек Gensim и spaCy. Экспериментальные исследования разработанной программной модели проведены на примере 3-х рабочих программ дисциплин (информационная безопасность, нейро-нечёткие системы и интеллектуальный анализ данных) и 3-х требований (рекомендаций) предприятий.
В первом эксперименте показано тематическое сходство текстов требований от разных предприятий и рабочих программ дисциплин кафедры. Значения метрики 𝑀 для требований и рабочих программ дисциплин представлены в таблице 1. Числовые значения, выделенные жирным шрифтом, правильно подчёркивают наибольшую тематическую связь требований с профилем рабочей программы.
| 𝒓 | ИБ | ННС | ИАД |
|---|---|---|---|
| Требования к специалистам по НС | 0.58 ± 0.2 | 0.72 ± 0.5 | 0.61 ± 0.05 |
| Требования к специалистам по ИАД | 0.51 ± 0.3 | 0.29 ± 0.4 | 0.98 ± 0.1 |
| Требования к специалистам по ИБ | 0.97 ± 0.3 | 0.34 ± 0.5 | 0.48 ± 0.2 |
Влияние параметров модели Doc2Vec на сходство текстов по смыслу
Исходные параметры модели Doc2Vec следующие:
Исследуем влияние некоторых параметров на оценку сходства документов требований предприятий и рабочих программ дисциплин по смыслу. Для эксперимента возьмем требования для специалиста по интеллектуальному анализу данных (ИАД): «Кандидат должен владеть технологиями анализа больших данных, уметь применять нейронные сети для анализа данных. Иметь представление о принципах обработки естественного языка, языковых моделях, методах поиска и генерации текстов. Знать возможности чат-бота ChatGPT. Знать методы извлечения знаний из разных источников знаний. Кандидат должен знать о возможностях пакетов Data Mining и Text Mining. Знать методы дискриминантного и кластерного анализа данных. Иметь представление о деревьях решений, критериях расщепления, знать алгоритм CART для построения деревьев решений. Знать смешанную модель авторегрессии».
Результат эксперимента по изменению количества эпох обучения продемонстрирован на рисунке 3.
На рисунке видно, что увеличение количества эпох обучения приводит к увеличению точности модели, но это также приводит к переобучению модели, но в нашей задаче это скорее полезно, так как документов РПД намного меньше чем документов требований. По итогу экспериментов можно заключить, что наиболее подходящее количество эпох находится в пределах 60-80, чтобы модель не успела сильно переобучиться на документах РПД.
Результат эксперимента по изменению размера вектора Doc2Vec продемонстрирован на рисунке 4.
Из рисунка видно, что размер вектора оказывает достаточно малое влияние на определение схожести при большом размере вектора, следовательно, он может быть сокращен для уменьшения количества вычислений и экономии вычислительных ресурсов. Исходя из экспериментальных данных, наилучшим вариантом является размер вектора 150.
Результат эксперимента по изменению размера контекстного окна Doc2Vec продемонстрирован на рисунке 5.
На рисунке видно, что слишком малый размер контекстного окна и слишком большой размер показывают схожие результаты. Также видно, что при увеличении размера окна до 2 слов резко повышается ложная схожесть с другими РПД, а затем, по мере увеличения размера окна, она плавно уменьшается, а значит наилучшую точность можно получить при большем значении размера окна. По итогам экспериментов подходящее значение находится в пределах от 8 и более. Такой большой размер связан с тем, что средняя длина предложения в документах РПД составляет в среднем 8 слов, при этом среднеквадратичное отклонение составляет приблизительно 15 слов, таким образом, чтобы покрыть все это предложение так, чтобы слово посередине имело в качестве контекста все предложение, нужен размер контекстного окна 11 ((8 + 15) / 2 = 11.5).
Влияние слов с высокой повторяемостью на сходство текстов по смыслу
Любой корпус документов содержит слова, которые есть в большинстве документов, и поэтому они не несут в себе много информации о документах. Исследуем определение схожести документов по смыслу в зависимости от удаления слов с высокой повторяемостью в различных документах. Результат эксперимента по исключению из документов слов с высокой частотой в корпусе продемонстрирован на рисунке 6.
На рисунке видно, что при удалении из текстов токенов, которые содержатся в более чем половине документов корпуса (частота 0.5), падает точность определения схожести документов по их косинусному подобию, а при увеличении частоты документов — увеличивается, так как падает ложная схожесть. Поэтому следует отказаться от удаления токенов с высокой частотой, так как это позволяет не терять информацию, необходимую для разделения документов по смыслу.
Влияние изменения порядка слов на сходство текстов
Так как Doc2Vec определяет вектор документа путем изучения контекста каждого слова, включенного в него, то необходимо оценить влияние перестановок слов в документах на результат обучения модели Doc2Vec [7]. Для этого исследуем определение схожести в зависимости от порядка предложений в тексте. Результат эксперимента по изменению порядка предложений продемонстрирован на рисунке 7. Было проведено 10 экспериментов, в которых предложения в текстах РПД переставлялись случайным образом.
На рисунке видно, что отклонение подобия документов составляет приблизительно 0.05, это значит, что перестановки предложений в тексте оказывают сравнительно небольшое влияние на конечное подобие векторов. Можно сделать вывод, что если размер окна Doc2Vec меньше средней длины предложения (5 < 8), то перестановки предложений не оказывают значительного влияния на компоненты вектора документа, так как меняется лишь порядок обучающих примеров для Doc2Vec. Далее проведем эксперимент с перестановками слов в предложениях, его результаты показаны на рисунке 8. Было проведено 10 экспериментов, в которых слова в предложениях текстов РПД переставлялись случайным образом.
Из рисунка следует, что перестановки слов в предложениях оказывают большее влияние на результат, чем перестановки предложений. Это также объясняется тем, что размер окна Doc2Vec меньше средней длины предложений в текстах РПД, таким образом меняются уже сами обучающие примеры, а не их порядок. Однако при данных исходных параметрах влияние мало, что видно на рисунке.
Таким образом, было исследовано влияние изменения порядка слов на определение сходства документов требований предприятий и РПД при помощи косинусного подобия векторов документов, вычисленных моделью Doc2Vec. Эксперименты показали, что данный подход хорошо показал себя в нашей задаче, так как позволяет свести к минимуму влияние словесных формулировок в текстовых документах при определении их сходства по смыслу.
Выводы
Разработанная система интеллектуального анализа текстов эффективно сопоставляет требования предприятий с рабочими программами дисциплин. Применение методов обработки естественного языка и высокоэффективных алгоритмов позволяет регулярно актуализировать РПД, улучшая взаимодействие между учебными заведениями и работодателями. Это способствует повышению уровня подготовки квалифицированных специалистов, соответствующих современным требованиям рынка труда, и открывает новые направления для автоматизации образовательных процессов.
Список литературы