ДонНТУ   Портал магистров

ПРИМЕНЕНИЕ ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ ДЛЯ МОДЕЛИРОВАНИЯ КАРЬЕРНОЙ СТРАТЕГИИ ПРОФЕССИОНАЛЬНОЙ ДЕЯТЕЛЬНОСТИ ПРЕПОДАВАТЕЛЯ

Киселёв Д.С., Федяев О.И. Применение обучения с подкреплением для моделирования карьерной стратегии профессиональной деятельности преподавателя // Интеллектуальные информационные системы (ИИС-2025): материалы Всероссийской научно-технической конференции. — 2025. – URL: https://иисконф.рф/

Киселёв Д.С., Федяев О.И.

Донецкий национальный технический университет
Кафедра программной инженерии им. Фельдмана
E-mail: danik.kis03@mail.ru, olegfedyayev@mail.ru

Введение

В предыдущих исследованиях авторов была продемонстрирована принципиальная возможность использования обучения с подкреплением (RL) для моделирования стратегий развития деятельности преподавателя [1]. Однако использованная модель не учитывала два важных аспекта реальной академической деятельности, таких как вероятностный характер исходов действий и феномен профессиональной деятельности: научную статью могут не принять в журнал, заявку на грант могут отклонить, а интенсивная работа приводит к снижению эффективности и требует периодов восстановления.

Целью данной работы является создание более реалистичной модели, обеспечивающей решение следующих задач:

Данное исследование позволит не только оценить эффективность различных RL-алгоритмов, но и продемонстрирует важность учёта ограниченности ресурсов преподавателя при планировании карьерной траектории [2].

Формализация стохастической среды моделирования

Для проведения сравнения указанных алгоритмов обучения с подкреплением была разработана единая имитационная среда «ProfessorEnv». Задача моделируется как Марковский процесс принятия решений (MDP) [3]. Формализуем среду моделирования.

Методология исследования

Для решения поставленных задач были реализованы два алгоритма с учётом специфики предметной области.

Q-Learning (табличный метод) [4]. Для данного алгоритма была создана Q-таблица, где строки соответствуют всем возможным состояниям, а столбцы – действиям. Пространство состояний является четырёхмерным и определяется следующими максимальными значениями параметров состояния: (11 × 6 × 11 × 21 = 15246 состояний), где последняя размерность соответствует дискретизированному уровню энергии (шаг принят равным 5). Была реализована функция преобразования четырёхмерного вектора состояния в уникальный одномерный индекс. Обучение происходит по классической формуле обновления Q-значения:

\[ Q(s, a) \leftarrow Q(s, a) + \alpha [r + \gamma \max Q(s', a') - Q(s, a)] \]

где \(s\) – текущее состояние; \(a\) – действие; \(r\) – награда; \(s'\) – следующее состояние; \(\alpha\) – скорость обучения; \(\gamma\) – коэффициент дисконтирования.

При увеличении размерности пространства состояний данный метод сталкивается с проблемой «проклятия размерности», что снижает его практическую применимость.

Double Deep Q-Network (Double DQN, нейросетевой метод) [5]. В качестве альтернативы был реализован усовершенствованный алгоритм Double DQN, решающий проблему переоценки Q-значений, присущую классическому DQN. В Double DQN ценность действий аппроксимируется нейронной сетью, при этом используется разделение ролей между двумя сетями:

Ключевые компоненты реализации: многослойный персептрон (128-128-4 нейрона), архитектура которого является стандартной для задач подобной сложности, а выходной слой из 4 нейронов соответствует четырём возможным действиям агента; каталог прошлых состояний и действий (Replay Memory), который сохраняется во время обучения агента для стабилизации обучения и мягкое обновление целевой сети (\(\tau = 0,005\)). Функция потерь минимизирует ошибку между предсказанием и целевым значением:

\[ L = E[(r + \gamma Q(s', \text{argmax} Q(s', a; \theta); \theta^-) - Q(s, a; \theta))^2] \]

где \(\theta\) – веса основной нейросети; \(\theta^-\) – веса целевой нейросети. Такой подход уменьшает систематическую переоценку Q-значений, что особенно важно в стохастической среде.

Экспериментальные исследования и анализ результатов

Эксперимент, посвящённый моделированию научно-педагогической деятельности преподавателя в рассмотренных ограничениях, проводился в несколько этапов. Сначала был запущен скрипт генерации, который создал файл набора данных, содержащий 50 уникальных профилей деятельности преподавателя. Затем оба алгоритма поочередно запускались на каждом из профилей для сбора данных о производительности.

Для обеспечения контролируемых и воспроизводимых условий эксперимента, сгенерированные профили были разделены на три разных архетипа: «Исследователь» (researcher), «Преподаватель» (teacher) и «Сбалансированный» (balanced). Цель такого разделения – протестировать способность алгоритмов адаптировать свои стратегии к различным структурам вознаграждений и вероятностям успеха. Ключевые параметры, определяющие каждый архетип, представлены в таблице 1.

Таблица 1 – Параметры синтетических профилей преподавателя
Параметры Исследователь Преподаватель Сбалансированный
Вероятность публикации 70-85% (Высокая) 30-45% (Низкая) 50-65% (Средняя)
Вероятность гранта 40-55% (Высокая) 20-35% (Низкая) 35-45% (Средняя)
Награда за публикацию 20 (Очень высокая) 10 (Средняя) 15 (Высокая)
Награда за грант 10 (Высокая) 5 (Низкая) 10 (Высокая)
Награда за преподавание 3 (Низкая) 10 (Высокая) 5 (Средняя)
Начальная энергия 70-85 75-90 70-85
Коэффициент восстановления 0,7-0,9 (Медленное) 1,1-1,3 (Быстрое) 0,9-1,1 (Среднее)
Начальные навыки 1-4 публикации 2-5 навыка преподавания 0-2 ед. всех сфер

Профиль «Исследователь» моделирует преподавателя, для которого приоритетны публикации и гранты, но при этом он более подвержен утомляемости (медленнее восстанавливается). Профиль «Преподаватель», напротив, получает основное вознаграждение за развитие педагогических навыков и обладает лучшей устойчивостью к выгоранию (быстрее восстанавливает энергию). Наконец, «Сбалансированный» профиль представляет собой усредненный тип со средними показателями по всем параметрам. Учёт механизма профессионального выгорания делает модель более реалистичной: агенты должны не только выбирать эффективные действия, но и управлять ресурсом энергии, периодически выбирая отдых для восстановления работоспособности. Эти различия позволяют провести глубокий анализ адаптивности алгоритмов Q-learning и Double DQN к различным профилям.

Сравнение алгоритмов на профиле «Исследователь». Для данного профиля приоритетной является награда за публикационную активность (вознаграждение = 20 за публикацию, вероятность успеха 75 %). В результате эксперимента Q-learning получил суммарную награду 129.6 условных единиц, что на 10 % выше, чем у Double DQN (награда равнялась 118 единиц). Однако, детальный анализ управления энергией выявил существенную разницу: средний уровень энергии Q-learning составил всего 9,4 (с полным истощением до 0), в то время как Double DQN поддерживал уровень 93,0 и никогда не опускаясь ниже 71. Разница в управлении энергией составила почти 10-кратное превосходство алгоритма DQN.

Анализ стратегий показывает фундаментальное различие подходов. Алгоритм Double DQN выработал устойчивую стратегию: чередование периодов активной работы (публикации) с восстановлением энергии. Агент поддерживает энергию на уровне 93-100, что обеспечивает максимальную эффективность действий. Алгоритм Q-learning, напротив, демонстрирует жадную стратегию: агрессивно максимизирует публикации без учёта истощения, что приводит к работе при практически нулевой энергии. При таком уровне выгорания вероятность успеха падает на 30 %, и агент получает множественные штрафы, но продолжает попытки публикации статей. Это подчёркивает недостаток табличного метода, то есть неспособность его прогнозировать долгосрочные последствия истощения ресурсов. На рисунке 1 наглядно показана разница в скорости и стабильности обучения двух алгоритмов.

Сравнение кривых обучения Q-learning и Double DQN на профиле «Исследователь»

Рисунок 1 – Сравнение кривых обучения Q-learning (сверху) и Double DQN (снизу) на профиле «Исследователь»

Сравнение на профиле «Учитель». Для данного профиля основной наградой является улучшение навыков преподавания (вознаграждение = 10 за преподавание против 10 за публикацию, но с низкой вероятностью успеха 34 %). Профиль характеризуется высокой устойчивостью к выгоранию (коэффициент восстановления 1,1). Эксперимент показал наибольшую разницу в наградах: Q-learning получил 103,0 против 81,0 у Double DQN, разница 27 %. Однако, разница в управлении энергией также оказалась критической: Double DQN поддерживал средний уровень 83,4 (минимум 20,0), в то время как Q-learning опустился до среднего 35,2 с полным истощением − разница в 2,4 раза.

Стратегии вновь продемонстрировали разные показатели. Алгоритм Double DQN достиг максимума преподавания (10 навыков) и перешёл к режиму поддержания энергии на безопасном уровне. Алгоритм Q-learning, используя преимущество быстрого восстановления профиля, агрессивно пытается максимизировать все показатели: преподавание, публикации и гранты. Несмотря на более высокую награду, эта стратегия приводит к циклам «истощение-восстановление», где агент периодически работает при нулевой энергии (рисунок 2).

Сравнение кривых обучения Q-learning и Double DQN на профиле «учитель»

Рисунок 2 – Сравнение кривых обучения Q-learning (сверху) и Double DQN (снизу) на профиле «учитель»

Обобщённый анализ и итоговая таблица. Аналогичная тенденция наблюдается и на сбалансированном профиле (рисунок 3), где Double DQN также демонстрирует более устойчивую стратегию управления энергией.

Сравнение кривых обучения Q-learning и Double DQN на профиле «сбалансированный»

Рисунок 3 – Сравнение кривых обучения Q-learning (сверху) и Double DQN (снизу) на профиле «сбалансированный»

Для систематизации результатов была составлена сводная таблица (таблица 2), демонстрирующая ключевые метрики обоих алгоритмов на различных профилях.

Таблица 2 – Параметры синтетических профилей преподавателя
Профиль Алгоритм Итоговая награда Средняя энергия
Учитель Double DQN 81,0 83,4
Учитель Q-Learning 103,0 35,2
Исследователь Double DQN 118,0 93,0
Исследователь Q-Learning 129,6 9,4
Сбалансированный Double DQN 62,0 93,0
Сбалансированный Q-Learning 69,5 11,1

Результаты выявляют системную закономерность: Q-learning получает на 10-27 % больше краткосрочной награды, но ценой катастрофического истощения ресурсов (снижение средней энергии на 58-90 %). Все три эксперимента с Q-learning привели к полному выгоранию (минимальная энергия равна 0), в то время как Double DQN ни разу не опустился ниже порога выгорания – 30. Наиболее драматичные различия наблюдаются на профилях «Исследователь» и «Сбалансированный», где DQN поддерживает энергию на уровне 93, а Q-learning опускается до 9,4 и 11,1 соответственно − падение почти в 10 раз. Данное наблюдение очень важно на практике: стратегия, максимизирующая краткосрочную награду через истощение, неприменима в реальной жизни, где выгорание имеет долгосрочные негативные последствия для здоровья и производительности.

Выводы

В данной работе было проведено сравнение классического алгоритма Q-learning и усовершенствованного Double DQN в задаче моделирования карьерной стратегии преподавателя с учётом профессионального выгорания [6,7]. Q-learning максимизирует краткосрочную награду в диапазоне (на 10-27 %), но систематически доводит агента до полного истощения, минимальная энергия равнялась 0 во всех трёх экспериментах.

Алгоритм Double DQN демонстрирует качественно иной подход к решению задачи: он учится прогнозировать долгосрочные последствия истощения и поэтому ограничивает активность для сохранения работоспособности. У него эффективность управления энергией выше в 2,4−10 раз, что свидетельствует о фундаментальном преимуществе нейросетевого подхода. Алгоритм Q-learning, оперирующий табличными Q-значениями в 15246-мерном пространстве состояний, не способен уловить сложные зависимости между текущими действиями и будущим истощением.

Double DQN предлагает применимые на практике решения, обеспечивающие баланс между производительностью и благополучием преподавателя. Ускорение обучения в 33 раза (600 против 20000 эпизодов) делает подход практически осуществимым.

Механизм выгорания не просто усложнил задачу, а сделал модель более реалистичной. Результаты показали, что «лучшая стратегия» определяется не максимальной краткосрочной наградой, а устойчивостью и безопасностью для агента. Это подтверждает возможность применения рассмотренной концепции в системах поддержки принятия решений в академической среде.

Результаты подтверждают возможность использования нейросетевых RL-алгоритмов для создания практически применимых интеллектуальных систем планирования академической карьеры преподавателей. Дальнейшие исследования могут включать более детальное моделирование последствий выгорания, учёт дополнительных факторов (семейная жизнь, административная нагрузка) и применение других современных алгоритмов обучения с подкреплением (A3C, PPO, SAC).

Список литературы

  1. Киселёв Д. С., Федяев О. И. Оптимизация стратегии профессионального развития преподавателя вуза с использованием обучения с подкреплением / Д. С. Киселёв, О. И. Федяев // Информатика, управляющие системы, математическое и компьютерное моделирование (ИУСМКМ-2025) : сб. материалов XVI Междунар. науч.-техн. конф. в рамках XI Междунар. науч. форума ДНР; Студенческая секция. – Донецк : ДонНТУ, 2025. – С. 148–153.
  2. Икласова К. Е., Шайханова А. К., Базарова М. Ж., Ташибаев Р. М., Казанбаева А. С. Обзор рекомендательных систем: модели и перспективы использования в образовательных платформах // Вестник Университета Шакарима. Серия технические науки. 2025. №1.
  3. Саттон, Р. С. Обучение с подкреплением / Р. С. Саттон, Э. Г. Барто. – 2-е изд. – Москва : ДМК Пресс, 2020. – 552 с.
  4. Watkins, C. J. C. H. Q-learning / C. J. C. H. Watkins, P. Dayan // Machine learning. – 1992. – Vol. 8, No. 3. – P. 279–292
  5. Van Hasselt, H. Deep Reinforcement Learning with Double Q-learning / H. Van Hasselt, A. Guez, D. Silver // Proceedings of the AAAI Conference on Artificial Intelligence. – 2016. – Vol. 30, No. 1. – P. 2094–2100
  6. Wang, S. A Deep Reinforcement Learning Framework for Personalized Curriculum Planning / S. Wang, H. Liu // IEEE Transactions on Learning Technologies. – 2022. – Vol. 15, No. 4. – P. 480–492
  7. Maslach, C. Job burnout / C. Maslach, W. B. Schaufeli, M. P. Leiter // Annual Review of Psychology. – 2001. – Vol. 52, No. 1. – P. 397–422