ПРИМЕНЕНИЕ ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ ДЛЯ МОДЕЛИРОВАНИЯ КАРЬЕРНОЙ СТРАТЕГИИ ПРОФЕССИОНАЛЬНОЙ ДЕЯТЕЛЬНОСТИ ПРЕПОДАВАТЕЛЯ
Киселёв Д.С., Федяев О.И. Применение обучения с подкреплением для моделирования карьерной стратегии профессиональной деятельности преподавателя // Интеллектуальные информационные системы (ИИС-2025): материалы Всероссийской научно-технической конференции. — 2025. – URL: https://иисконф.рф/
Киселёв Д.С., Федяев О.И.
Донецкий национальный технический университет
Кафедра программной инженерии им. Фельдмана
E-mail:
danik.kis03@mail.ru,
olegfedyayev@mail.ru
Введение
В предыдущих исследованиях авторов была продемонстрирована принципиальная возможность использования обучения с подкреплением (RL) для моделирования стратегий развития деятельности преподавателя [1]. Однако использованная модель не учитывала два важных аспекта реальной академической деятельности, таких как вероятностный характер исходов действий и феномен профессиональной деятельности: научную статью могут не принять в журнал, заявку на грант могут отклонить, а интенсивная работа приводит к снижению эффективности и требует периодов восстановления.
Целью данной работы является создание более реалистичной модели, обеспечивающей решение следующих задач:
- разработка стохастической имитационной среды с учётом вероятностных исходов профессиональных активностей;
- интеграция механизма профессиональной деятельности (в дальнейшем «выгорания») как дополнительного параметра состояния, влияющего на эффективность действий преподавателя;
- расширение модели за счёт включения грантовой деятельности;
- сравнительный анализ классического Q-learning и усовершенствованного алгоритма Double DQN, решающего проблему переоценки Q-значений.
Данное исследование позволит не только оценить эффективность различных RL-алгоритмов, но и продемонстрирует важность учёта ограниченности ресурсов преподавателя при планировании карьерной траектории [2].
Формализация стохастической среды моделирования
Для проведения сравнения указанных алгоритмов обучения с подкреплением была разработана единая имитационная среда «ProfessorEnv». Задача моделируется как Марковский процесс принятия решений (MDP) [3]. Формализуем среду моделирования.
- Агент: алгоритм (Q-learning или Double DQN), вырабатывающий рекомендации по оптимальным действиям.
- Среда: имитационная модель карьеры преподавателя, настроенная с помощью одного из множества синтетически сгенерированных «профилей».
- Состояние (S): вектор из четырёх компонентов, описывающий текущее состояние преподавателя («количество_публикаций», «количество_грантов», «уровень_преподавания», «уровень_энергии»). Параметр энергии принимает значения в диапазоне [0; 100] и отражает текущую работоспособность преподавателя.
- Действия (А): набор из четырёх возможных действий: «Опубликовать статью», «Подать на грант», «Улучшить преподавание», «Отдых/восстановление».
- Функция перехода и вознаграждение (R): она является стохастической. При выборе активных действий (публикация, грант, преподавание) успех происходит с определённой вероятностью, зависящей от профиля и текущего уровня энергии. В исследованиях было принято, что каждое активное действие снижает энергию на определённую величину (публикация/грант: -15, преподавание: -10), а действие «Отдых» увеличивает её (+20 с учётом индивидуального коэффициента восстановления). При значении энергии ниже 30 (принятый порог выгорания) вероятность успеха и величина наград снижаются на 30 %. Принципиальное значение здесь имеет не абсолютная величина цифр, а их соотношение: научная деятельность является более ресурсозатратной, чем преподавательская, а отдых предоставляет достаточное восстановление, чтобы быть стратегически выгодным выбором для избегания выгорания.
Методология исследования
Для решения поставленных задач были реализованы два алгоритма с учётом специфики предметной области.
Q-Learning (табличный метод) [4]. Для данного алгоритма была создана Q-таблица, где строки соответствуют всем возможным состояниям, а столбцы – действиям. Пространство состояний является четырёхмерным и определяется следующими максимальными значениями параметров состояния: (11 × 6 × 11 × 21 = 15246 состояний), где последняя размерность соответствует дискретизированному уровню энергии (шаг принят равным 5). Была реализована функция преобразования четырёхмерного вектора состояния в уникальный одномерный индекс. Обучение происходит по классической формуле обновления Q-значения:
\[ Q(s, a) \leftarrow Q(s, a) + \alpha [r + \gamma \max Q(s', a') - Q(s, a)] \]
где \(s\) – текущее состояние; \(a\) – действие; \(r\) – награда; \(s'\) – следующее состояние; \(\alpha\) – скорость обучения; \(\gamma\) – коэффициент дисконтирования.
При увеличении размерности пространства состояний данный метод сталкивается с проблемой «проклятия размерности», что снижает его практическую применимость.
Double Deep Q-Network (Double DQN, нейросетевой метод) [5]. В качестве альтернативы был реализован усовершенствованный алгоритм Double DQN, решающий проблему переоценки Q-значений, присущую классическому DQN. В Double DQN ценность действий аппроксимируется нейронной сетью, при этом используется разделение ролей между двумя сетями:
- Нейросеть принятия решений «Policy Network» выбирает оптимальное действие: \[ a = \text{argmax} Q(s', a; \theta) \]
- Целевая нейросеть «Target Network» оценивает выбранное действие: \[ Q(s', a; \theta^-) \]
Ключевые компоненты реализации: многослойный персептрон (128-128-4 нейрона), архитектура которого является стандартной для задач подобной сложности, а выходной слой из 4 нейронов соответствует четырём возможным действиям агента; каталог прошлых состояний и действий (Replay Memory), который сохраняется во время обучения агента для стабилизации обучения и мягкое обновление целевой сети (\(\tau = 0,005\)). Функция потерь минимизирует ошибку между предсказанием и целевым значением:
\[ L = E[(r + \gamma Q(s', \text{argmax} Q(s', a; \theta); \theta^-) - Q(s, a; \theta))^2] \]
где \(\theta\) – веса основной нейросети; \(\theta^-\) – веса целевой нейросети. Такой подход уменьшает систематическую переоценку Q-значений, что особенно важно в стохастической среде.
Экспериментальные исследования и анализ результатов
Эксперимент, посвящённый моделированию научно-педагогической деятельности преподавателя в рассмотренных ограничениях, проводился в несколько этапов. Сначала был запущен скрипт генерации, который создал файл набора данных, содержащий 50 уникальных профилей деятельности преподавателя. Затем оба алгоритма поочередно запускались на каждом из профилей для сбора данных о производительности.
Для обеспечения контролируемых и воспроизводимых условий эксперимента, сгенерированные профили были разделены на три разных архетипа: «Исследователь» (researcher), «Преподаватель» (teacher) и «Сбалансированный» (balanced). Цель такого разделения – протестировать способность алгоритмов адаптировать свои стратегии к различным структурам вознаграждений и вероятностям успеха. Ключевые параметры, определяющие каждый архетип, представлены в таблице 1.
| Параметры | Исследователь | Преподаватель | Сбалансированный |
|---|---|---|---|
| Вероятность публикации | 70-85% (Высокая) | 30-45% (Низкая) | 50-65% (Средняя) |
| Вероятность гранта | 40-55% (Высокая) | 20-35% (Низкая) | 35-45% (Средняя) |
| Награда за публикацию | 20 (Очень высокая) | 10 (Средняя) | 15 (Высокая) |
| Награда за грант | 10 (Высокая) | 5 (Низкая) | 10 (Высокая) |
| Награда за преподавание | 3 (Низкая) | 10 (Высокая) | 5 (Средняя) |
| Начальная энергия | 70-85 | 75-90 | 70-85 |
| Коэффициент восстановления | 0,7-0,9 (Медленное) | 1,1-1,3 (Быстрое) | 0,9-1,1 (Среднее) |
| Начальные навыки | 1-4 публикации | 2-5 навыка преподавания | 0-2 ед. всех сфер |
Профиль «Исследователь» моделирует преподавателя, для которого приоритетны публикации и гранты, но при этом он более подвержен утомляемости (медленнее восстанавливается). Профиль «Преподаватель», напротив, получает основное вознаграждение за развитие педагогических навыков и обладает лучшей устойчивостью к выгоранию (быстрее восстанавливает энергию). Наконец, «Сбалансированный» профиль представляет собой усредненный тип со средними показателями по всем параметрам. Учёт механизма профессионального выгорания делает модель более реалистичной: агенты должны не только выбирать эффективные действия, но и управлять ресурсом энергии, периодически выбирая отдых для восстановления работоспособности. Эти различия позволяют провести глубокий анализ адаптивности алгоритмов Q-learning и Double DQN к различным профилям.
Сравнение алгоритмов на профиле «Исследователь». Для данного профиля приоритетной является награда за публикационную активность (вознаграждение = 20 за публикацию, вероятность успеха 75 %). В результате эксперимента Q-learning получил суммарную награду 129.6 условных единиц, что на 10 % выше, чем у Double DQN (награда равнялась 118 единиц). Однако, детальный анализ управления энергией выявил существенную разницу: средний уровень энергии Q-learning составил всего 9,4 (с полным истощением до 0), в то время как Double DQN поддерживал уровень 93,0 и никогда не опускаясь ниже 71. Разница в управлении энергией составила почти 10-кратное превосходство алгоритма DQN.
Анализ стратегий показывает фундаментальное различие подходов. Алгоритм Double DQN выработал устойчивую стратегию: чередование периодов активной работы (публикации) с восстановлением энергии. Агент поддерживает энергию на уровне 93-100, что обеспечивает максимальную эффективность действий. Алгоритм Q-learning, напротив, демонстрирует жадную стратегию: агрессивно максимизирует публикации без учёта истощения, что приводит к работе при практически нулевой энергии. При таком уровне выгорания вероятность успеха падает на 30 %, и агент получает множественные штрафы, но продолжает попытки публикации статей. Это подчёркивает недостаток табличного метода, то есть неспособность его прогнозировать долгосрочные последствия истощения ресурсов. На рисунке 1 наглядно показана разница в скорости и стабильности обучения двух алгоритмов.
Рисунок 1 – Сравнение кривых обучения Q-learning (сверху) и Double DQN (снизу) на профиле «Исследователь»
Сравнение на профиле «Учитель». Для данного профиля основной наградой является улучшение навыков преподавания (вознаграждение = 10 за преподавание против 10 за публикацию, но с низкой вероятностью успеха 34 %). Профиль характеризуется высокой устойчивостью к выгоранию (коэффициент восстановления 1,1). Эксперимент показал наибольшую разницу в наградах: Q-learning получил 103,0 против 81,0 у Double DQN, разница 27 %. Однако, разница в управлении энергией также оказалась критической: Double DQN поддерживал средний уровень 83,4 (минимум 20,0), в то время как Q-learning опустился до среднего 35,2 с полным истощением − разница в 2,4 раза.
Стратегии вновь продемонстрировали разные показатели. Алгоритм Double DQN достиг максимума преподавания (10 навыков) и перешёл к режиму поддержания энергии на безопасном уровне. Алгоритм Q-learning, используя преимущество быстрого восстановления профиля, агрессивно пытается максимизировать все показатели: преподавание, публикации и гранты. Несмотря на более высокую награду, эта стратегия приводит к циклам «истощение-восстановление», где агент периодически работает при нулевой энергии (рисунок 2).
Рисунок 2 – Сравнение кривых обучения Q-learning (сверху) и Double DQN (снизу) на профиле «учитель»
Обобщённый анализ и итоговая таблица. Аналогичная тенденция наблюдается и на сбалансированном профиле (рисунок 3), где Double DQN также демонстрирует более устойчивую стратегию управления энергией.
Рисунок 3 – Сравнение кривых обучения Q-learning (сверху) и Double DQN (снизу) на профиле «сбалансированный»
Для систематизации результатов была составлена сводная таблица (таблица 2), демонстрирующая ключевые метрики обоих алгоритмов на различных профилях.
| Профиль | Алгоритм | Итоговая награда | Средняя энергия |
|---|---|---|---|
| Учитель | Double DQN | 81,0 | 83,4 |
| Учитель | Q-Learning | 103,0 | 35,2 |
| Исследователь | Double DQN | 118,0 | 93,0 |
| Исследователь | Q-Learning | 129,6 | 9,4 |
| Сбалансированный | Double DQN | 62,0 | 93,0 |
| Сбалансированный | Q-Learning | 69,5 | 11,1 |
Результаты выявляют системную закономерность: Q-learning получает на 10-27 % больше краткосрочной награды, но ценой катастрофического истощения ресурсов (снижение средней энергии на 58-90 %). Все три эксперимента с Q-learning привели к полному выгоранию (минимальная энергия равна 0), в то время как Double DQN ни разу не опустился ниже порога выгорания – 30. Наиболее драматичные различия наблюдаются на профилях «Исследователь» и «Сбалансированный», где DQN поддерживает энергию на уровне 93, а Q-learning опускается до 9,4 и 11,1 соответственно − падение почти в 10 раз. Данное наблюдение очень важно на практике: стратегия, максимизирующая краткосрочную награду через истощение, неприменима в реальной жизни, где выгорание имеет долгосрочные негативные последствия для здоровья и производительности.
Выводы
В данной работе было проведено сравнение классического алгоритма Q-learning и усовершенствованного Double DQN в задаче моделирования карьерной стратегии преподавателя с учётом профессионального выгорания [6,7]. Q-learning максимизирует краткосрочную награду в диапазоне (на 10-27 %), но систематически доводит агента до полного истощения, минимальная энергия равнялась 0 во всех трёх экспериментах.
Алгоритм Double DQN демонстрирует качественно иной подход к решению задачи: он учится прогнозировать долгосрочные последствия истощения и поэтому ограничивает активность для сохранения работоспособности. У него эффективность управления энергией выше в 2,4−10 раз, что свидетельствует о фундаментальном преимуществе нейросетевого подхода. Алгоритм Q-learning, оперирующий табличными Q-значениями в 15246-мерном пространстве состояний, не способен уловить сложные зависимости между текущими действиями и будущим истощением.
Double DQN предлагает применимые на практике решения, обеспечивающие баланс между производительностью и благополучием преподавателя. Ускорение обучения в 33 раза (600 против 20000 эпизодов) делает подход практически осуществимым.
Механизм выгорания не просто усложнил задачу, а сделал модель более реалистичной. Результаты показали, что «лучшая стратегия» определяется не максимальной краткосрочной наградой, а устойчивостью и безопасностью для агента. Это подтверждает возможность применения рассмотренной концепции в системах поддержки принятия решений в академической среде.
Результаты подтверждают возможность использования нейросетевых RL-алгоритмов для создания практически применимых интеллектуальных систем планирования академической карьеры преподавателей. Дальнейшие исследования могут включать более детальное моделирование последствий выгорания, учёт дополнительных факторов (семейная жизнь, административная нагрузка) и применение других современных алгоритмов обучения с подкреплением (A3C, PPO, SAC).
Список литературы
- Киселёв Д. С., Федяев О. И. Оптимизация стратегии профессионального развития преподавателя вуза с использованием обучения с подкреплением / Д. С. Киселёв, О. И. Федяев // Информатика, управляющие системы, математическое и компьютерное моделирование (ИУСМКМ-2025) : сб. материалов XVI Междунар. науч.-техн. конф. в рамках XI Междунар. науч. форума ДНР; Студенческая секция. – Донецк : ДонНТУ, 2025. – С. 148–153.
- Икласова К. Е., Шайханова А. К., Базарова М. Ж., Ташибаев Р. М., Казанбаева А. С. Обзор рекомендательных систем: модели и перспективы использования в образовательных платформах // Вестник Университета Шакарима. Серия технические науки. 2025. №1.
- Саттон, Р. С. Обучение с подкреплением / Р. С. Саттон, Э. Г. Барто. – 2-е изд. – Москва : ДМК Пресс, 2020. – 552 с.
- Watkins, C. J. C. H. Q-learning / C. J. C. H. Watkins, P. Dayan // Machine learning. – 1992. – Vol. 8, No. 3. – P. 279–292
- Van Hasselt, H. Deep Reinforcement Learning with Double Q-learning / H. Van Hasselt, A. Guez, D. Silver // Proceedings of the AAAI Conference on Artificial Intelligence. – 2016. – Vol. 30, No. 1. – P. 2094–2100
- Wang, S. A Deep Reinforcement Learning Framework for Personalized Curriculum Planning / S. Wang, H. Liu // IEEE Transactions on Learning Technologies. – 2022. – Vol. 15, No. 4. – P. 480–492
- Maslach, C. Job burnout / C. Maslach, W. B. Schaufeli, M. P. Leiter // Annual Review of Psychology. – 2001. – Vol. 52, No. 1. – P. 397–422