ДонНТУ   Портал магистров

ПРИМЕНЕНИЕ МЕТОДОВ ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ ДЛЯ ВЫРАБОТКИ ОПТИМАЛЬНОЙ СТРАТЕГИИ ДЕЯТЕЛЬНОСТИ ПРЕПОДАВАТЕЛЯ ПО ЕГО КЛЮЧЕВЫМ ПОКАЗАТЕЛЯМ

Информационные технологии в науке, промышленности и образовании (ITSIT-2025) : сб. материалов Всерос. науч.-техн. конф. / ФГБОУ ВО «Кузбас. гос. техн. ун-т им. Т. Ф. Горбачева». – Кемерово, 2025. – С. 411. — Ссылка на сборник

Киселёв Д.С., Федяев О.И.

Донецкий национальный технический университет
Кафедра программной инженерии им. Фельдмана
E-mail: danik.kis03@mail.ru, olegfedyayev@mail.ru

Введение

В предыдущих исследованиях была продемонстрирована принципиальная возможность использования обучения с подкреплением (RL) для моделирования стратегий развития деятельности преподавателя [1]. Однако использованная модель имела два существенных упрощения: детерминированность среды (действия всегда приводили к успеху) и ограниченное пространство состояний. В реальности академическая деятельность преподавателя полна неопределенности: научную статью могут не принять в журнал, заявка на грант может быть отклонена и др.

Целью данной работы является развитие предыдущих результатов путём решения следующего ряда задач:

  1. разработка более реалистичной, стохастической имитационной среды, учитывающей вероятностный характер исхода некоторых профессиональных активностей;
  2. расширение модели за счёт добавления новых состояний и действий, в частности, грантовой активности;
  3. проведение сравнительного анализа двух ключевых RL-алгоритмов – классического табличного Q-learning и нейросетевого Deep Q-Network (DQN) – в условиях новой, более сложной среды.

Данное исследование позволит оценить, какой из подходов более эффективен для построения интеллектуальных систем поддержки принятия решений в условиях, приближенных к реальным [2].

Формализация стохастической задачи

Для проведения сравнения указанных алгоритмов обучения с подкреплением была разработана единая имитационная среда «ProfessorEnv». Задача моделируется как Марковский процесс принятия решений (MDP) [3]. Формализуем среду.

Методология исследования

Для решения поставленной задачи были реализованы и адаптированы два алгоритма.

Q-Learning (табличный метод). Для данного алгоритма была создана Q-таблица, где строки соответствуют всем возможным состояниям, а столбцы – действиям [4]. Так как пространство состояний трёхмерное, была реализована функция, преобразующая трёхмерный вектор состояния в уникальный одномерный индекс для доступа к строке таблицы. Обучение происходит по классической формуле обновления Q-значения:

\[ Q(s, a) \leftarrow Q(s, a) + \alpha [r + \gamma \max_{a'} Q(s', a') - Q(s, a)] \]

где \(s\) – текущее состояние; \(a\) – действие; \(r\) – награда; \(s'\) – следующее состояние; \(\alpha\) – скорость обучения; \(\gamma\) – коэффициент дисконтирования. Несмотря на свою простоту, данный метод сталкивается с проблемой «проклятия размерности».

Deep Q-Network (DQN, нейросетевой метод). В качестве альтернативы был реализован алгоритм DQN. В нём ценность действий (Q-values) аппроксимируется с помощью нейронной сети. Ключевые особенности реализованного DQN-агента: архитектура сети (многослойный персептрон), Replay Memory (память воспроизведения) и Target Network (целевая сеть). Функция потерь (Loss) минимизирует среднеквадратичную ошибку между предсказанием сети \(Q(s, a; \theta)\) и целевым значением \(Y_t\):

\[ L = E[(r + \gamma \max_{a'} Q(s', a'; \theta^-) - Q(s, a; \theta))^2] \]

здесь \(\theta\) – веса основной сети; \(\theta^-\) – веса целевой сети, которые периодически обновляются.

Экспериментальные исследования и анализ результатов

Эксперимент проводился в несколько этапов. Сначала был запущен скрипт генерации, который создал файл набора данных, содержащий 50 уникальных профилей преподавателей. Затем оба алгоритма поочередно запускались на каждом из профилей для сбора данных о производительности.

Для обеспечения контролируемых и воспроизводимых условий эксперимента, сгенерированные профили были разделены на три разных архетипа: «Исследователь» (researcher), «Преподаватель» (teacher) и «Сбалансированный» (balanced). Цель такого разделения – протестировать способность алгоритмов адаптировать свои стратегии к различным структурам вознаграждений и вероятностям успеха. Ключевые параметры, определяющие каждый архетип, представлены в таблице 1.

Таблица 1. Параметры синтетических профилей преподавателей
Параметр Researcher (Исследователь) Teacher (Преподаватель) Balanced (Сбалансированный)
Вероятность публикации 70-85% (Высокая) 30-45% (Низкая) 50-65% (Средняя)
Вероятность гранта 40-55% (Высокая) 20-35% (Низкая) 35-45% (Средняя)
Награда за публикацию 20 (Очень высокая) 10 (Средняя) 15 (Высокая)
Награда за грант 10 (Высокая) 5 (Низкая) 10 (Высокая)
Награда за преподавание 3 (Низкая) 10 (Высокая) 5 (Средняя)
Начальные навыки 1-4 публикации 2-5 навыка преподавания 0-2 ед. всех сфер

Профиль «Исследователь» моделирует учёного, для которого приоритетны публикации и гранты. Профиль «Преподаватель», напротив, получает основное вознаграждение за развитие педагогических навыков. Наконец, «Сбалансированный» профиль представляет собой усредненный тип без ярко выраженных сильных сторон, с равными возможностями для развития в различных направлениях. Именно эти фундаментальные различия в параметрах среды позволяют провести глубокий сравнительный анализ стратегий, вырабатываемых алгоритмами Q-learning и DQN.

Сравнение на профиле «researcher». Для данного профиля приоритетной является награда за публикационную активность. На рисунке 1 представлены кривые обучения для Q-learning и DQN.

Сравнение кривых обучения Q-learning и DQN на профиле «researcher»

Рис. 1. Сравнение кривых обучения Q-learning и DQN на профиле «researcher»

Анализ графиков показывает, что алгоритм DQN демонстрирует значительно более высокую скорость обучения. Он достигает стабильного плато средней награды (около 200-210) уже примерно к 250-300-му эпизоду. Классическому Q-learning, в свою очередь, требуется около 5000-7500 эпизодов, чтобы достичь сопоставимого, хотя и несколько более высокого плато (около 225-230). При этом итоговые результаты DQN выглядят более стабильными, с меньшим разбросом суммарной награды от эпизода к эпизоду после выхода на плато. Это говорит о значительной вычислительной эффективности DQN в поиске оптимальной стратегии. Анализ выученных стратегий показывает, что DQN быстрее находит гибкую политику, начиная чередовать публикации с попытками получить грант, тогда как Q-Learning дольше придерживается более прямолинейных действий. Это может свидетельствовать о том, что DQN лучше уловил долгосрочную ценность грантов, даже при меньшей немедленной награде по сравнению с публикациями.

Сравнение на профиле «teacher». Для данного профиля основной наградой является улучшение навыков преподавания.

Сравнение кривых обучения Q-learning и DQN на профиле «teacher»

Рис. 2. Сравнение кривых обучения Q-learning и DQN на профиле «teacher»

Анализ графиков для профиля «teacher» (рис. 2) показывает схожую с «researcher» тенденцию: DQN сходится значительно быстрее. Стабильный результат со средней наградой около 80-90 достигается уже к 100-му эпизоду. Q-learning выходит на плато со средней наградой около 120 лишь после 2500-4000 эпизодов. Анализ выученных стратегий демонстрирует интересную особенность: оба алгоритма быстро определяют преподавание как основной источник наград. Однако после достижения максимального уровня в этой области, Q-Learning начинает рисковать, пытаясь получить маловероятную награду от публикаций, в то время как DQN, оценив низкие шансы на успех, выбирает бездействие, что является более оптимальной стратегией для данного профиля, минимизирующей потери.

Сравнение на профиле «balanced». Наконец, был проведен эксперимент на «balanced» профиле, который не имеет ярко выраженной склонности к одной из активностей.

Сравнение кривых обучения Q-learning и DQN на профиле «balanced»

Рис. 3. Сравнение кривых обучения Q-learning и DQN на профиле «balanced»

На «balanced» профиле (рис. 3) преимущество DQN проявляется наиболее ярко. Алгоритм выходит на стабильное плато со средней наградой около 150-200-му эпизоду. Q-learning достигает того же уровня производительности лишь после 2500-5000 эпизодов. В данном случае DQN не только обучается на порядок быстрее, но и достигает абсолютно сопоставимого по качеству результата. Анализ стратегий показывает, что DQN находит более структурированный подход: сначала достигает высокого уровня в преподавании, а затем переключается на публикации. Стратегия Q-Learning выглядит более хаотичной и заключается в частом переключении между активностями на протяжении всего эпизода.

Выводы

В данной работе было проведено сравнение классического алгоритма Q-learning и нейросетевого DQN в задаче моделирования карьерной стратегии преподавателя в стохастической среде. Было показано, что в условиях неопределенности и более сложного пространства состояний алгоритм DQN демонстрирует значительное преимущество в скорости обучения и качестве итоговой стратегии по сравнению с табличным Q-learning. Результаты подтверждают гипотезу о том, что для создания реалистичных и эффективных систем поддержки принятия решений в академической среде целесообразно использовать более продвинутые RL-алгоритмы. Дальнейшие исследования могут быть направлены на обогащение среды новыми факторами, а также на применение других современных RL-алгоритмов, таких как A2C или PPO [5].

Список литературы

  1. Киселёв Д. С., Федяев О. И. Оптимизация стратегии профессионального развития преподавателя вуза с использованием обучения с подкреплением / Д. С. Киселёв, О. И. Федяев // Информатика, управляющие системы, математическое и компьютерное моделирование (ИУСМКМ-2025) : сб. материалов XVI Междунар. науч.-техн. конф. в рамках XI Междунар. науч. форума ДНР; Студенческая секция. – Донецк : ДонНТУ, 2025. – С. 148–153.
  2. Икласова К. Е., Шайханова А. К. и др. Обзор рекомендательных систем: модели и перспективы использования в образовательных платформах // Вестник Университета Шакарима. Серия технические науки. 2025. №1.
  3. Саттон, Р. С. Обучение с подкреплением / Р. С. Саттон, Э. Г. Барто. – 2-е изд. – Москва : ДМК Пресс, 2020. – 552 с.
  4. Watkins, C. J. C. H. Q-learning / C. J. C. H. Watkins, P. Dayan // Machine learning. – 1992. – Vol. 8, No. 3. – P. 279–292.
  5. Wang, S. A Deep Reinforcement Learning Framework for Personalized Curriculum Planning / S. Wang, H. Liu // IEEE Transactions on Learning Technologies. – 2022. – Vol. 15, No. 4. – P. 480–492.