ДонНТУ   Портал магистров

ОПТИМИЗАЦИЯ СТРАТЕГИИ ПРОФЕССИОНАЛЬНОГО РАЗВИТИЯ ПРЕПОДАВАТЕЛЯ ВУЗА С ИСПОЛЬЗОВАНИЕМ ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ

Киселёв Д.С., Федяев О.И. Оптимизация стратегии профессионального развития преподавателя вуза с использованием обучения с подкреплением // Материалы X Международной научно-практической конференции "Программная инженерия: методы и технологии разработки информационно-вычислительных систем". — Донецк, ДонНТУ, 2025. — Ссылка на сборник

Киселёв Д.С., Федяев О.И.

Донецкий национальный технический университет
Кафедра программной инженерии им. Фельдмана
E-mail: danik.kis03@mail.ru, olegfedyayev@mail.ru

Аннотация

В статье рассматривается применение методов обучения с подкреплением (Reinforcement Learning, RL) для создания рекомендательной системы, направленной на оптимизацию профессионального развития преподавателей высших учебных заведений. Предлагается модель, формализующая задачу выбора активностей (научная работа, методическая деятельность, повышение квалификации) как последовательный процесс принятия решений. Агент RL обучается предлагать преподавателю действия, максимизирующие его рейтинг или другие показатели эффективности в рамках имитационной среды, учитывающей правила и критерии оценки деятельности в вузе. Описываются ключевые компоненты RL-подхода: состояние, действие, вознаграждение, а также приводится пример реализации простого Q-learning алгоритма для данной задачи. Обсуждаются перспективы и ограничения использования подобных систем.

Ключевые слова: обучение с подкреплением, система принятия решений, рейтинг преподавателей, профессиональное развитие, Q-learning, симуляция, оптимизация стратегии.

Общая постановка проблемы

Современная деятельность преподавателя высшего учебного заведения характеризуется многообразием направлений: учебная, методическая, научная, воспитательная, организационная работа. Эффективное распределение времени и ресурсов между этими активностями для достижения карьерных целей и повышения персонального рейтинга является сложной задачей. Преподаватели часто сталкиваются с необходимостью принимать решения о том, на каких аспектах своей деятельности сосредоточиться, чтобы максимизировать свой вклад и признание в академической среде [1].

Традиционные подходы к планированию карьеры могут быть негибкими и не всегда учитывать динамически меняющиеся требования и приоритеты университета. В этом контексте перспективным направлением является применение методов искусственного интеллекта, в частности, обучения с подкреплением (Reinforcement Learning, RL), для создания интеллектуальных систем поддержки принятия решений. RL-агенты способны обучаться оптимальным стратегиям поведения путем взаимодействия со средой и получения обратной связи, что делает их подходящими для задач с отложенными наградами и необходимостью балансировать между исследованием новых возможностей и использованием уже известных успешных действий [2].

Данная статья посвящена разработке концепции и имитационной модели рекомендательной системы для преподавателей на основе RL. Целью системы является помощь преподавателю в выборе последовательности действий для максимизации его суммарного вознаграждения, представленного, например, изменением его рейтинга в вузе.

Принципы обучения с подкреплением

Обучение с подкреплением – это область машинного обучения, в которой агент учится принимать решения, взаимодействуя со средой, чтобы максимизировать некоторую кумулятивную награду. Основные компоненты RL: агент, среда, состояние, действие, вознаграждение, политика [3].

Процесс обучения в RL итеративен: агент наблюдает состояние, выбирает действие согласно своей политике, выполняет его, получает вознаграждение и переходит в новое состояние. Цель агента – найти оптимальную политику (обучиться действовать оптимально).

На рисунке 1 представлена обобщённая схема обучения с подкреплением.

Обобщенная схема взаимодействия агента и среды в RL

Рис. 1. Обобщенная схема взаимодействия агента и среды в RL

Формализация задачи для рейтинговой системы преподавателя

Для применения RL к задаче оптимизации стратегии профессионального развития преподавателя необходимо формализовать её в терминах состояний, действий и вознаграждений.

В таблице 1 представлены компоненты задачи для упрощенной модели.

Таблица 1 – Компоненты RL-задачи для моделирования рейтинга преподавателя
Компонент Описание Пример
Состояние (S) Текущие показатели преподавателя (Кол-во публикаций: 2, Качество преподавания: 3)
Действия (A) Возможные активности "Опубликовать статью", "Улучшить курс", "Ничего не менять"
Вознаграждение (R) Изменение рейтинга или оценка полезности действия +10 за статью, +5 за улучшение курса, +1 за "ничего не менять", -1 за попытку превысить максимум
Цель Агента Максимизировать суммарное вознаграждение (рейтинг) за определенный период Выработать последовательность действий, приводящую к наивысшему возможному рейтингу в конце периода

Выбор и реализация алгоритма обучения с подкреплением

Существует множество алгоритмов RL, таких как Q-learning, SARSA, Deep Q-Networks (DQN), Policy Gradient методы [4]. Для данной задачи, особенно на начальном этапе исследования и с учётом дискретного и относительно небольшого пространства состояний и действий, хорошо подходит классический алгоритм Q-learning.

Q-learning – это model-free алгоритм, который обучается функции ценности действия (Q-function). Q-функция, \(Q(s,a)\), оценивает ожидаемое суммарное дисконтированное вознаграждение при выполнении действия \(a\) в состоянии \(s\) и последующем следовании оптимальной политике. Q-значения хранятся в Q-таблице, где строки соответствуют состояниям, а столбцы – действиям.

Обновление Q-значений происходит по формуле:

\[ Q(s, a) \leftarrow Q(s, a) + \alpha [r + \gamma \max_{a'} Q(s', a') - Q(s, a)] \tag{1} \]

где: \(\alpha\) – скорость обучения; \(\gamma\) – коэффициент дисконтирования; \(r\) – полученное вознаграждение; \(s'\) – новое состояние.

Для баланса между исследованием новых действий и использованием уже известных оптимальных действий применяется \(\varepsilon\)-жадная стратегия.

Моделирование среды и экспериментальные результаты

Для обучения и тестирования RL-агента была создана имитационная среда на языке Python, воспроизводящая упрощенную систему оценки деятельности преподавателя.

На рисунке 2 показан процесс обучения агента на протяжении 90000 эпизодов. График отображает суммарное вознаграждение, полученное агентом в каждом эпизоде. В начале обучения вознаграждение низкое и сильно варьируется, что связано с активным исследованием среды. По мере обучения агент начинает чаще использовать оптимальные действия, и суммарное вознаграждение стабилизируется на высоком уровне.

Процесс обучения агента: суммарное вознаграждение за эпизод

Рис. 2. Процесс обучения агента: суммарное вознаграждение за эпизод

Для демонстрации нахождения лучшей стратегии рассмотрим поведение агента, обученного на протяжении 3000 эпизодов. Пример траектории действий, выбранных агентом, и полученные вознаграждения представлены на рисунке 3.

Динамика поиска лучшей стратегии

Рис. 3. Динамика поиска лучшей стратегии

На рисунке 4 показан фрагмент Q-таблицы после обучения. Видно, что для состояний с низким числом публикаций агент присваивает более высокие Q-значения действию «Опубликовать статью».

Фрагмент Q-таблицы после обучения

Рис. 4. Фрагмент Q-таблицы после обучения, показывающий предпочтения агента для действий

Анализ реализации

Предложенный подход демонстрирует принципиальную возможность использования RL для создания рекомендательных систем в сфере профессионального развития. Ключевые преимущества: система может адаптироваться к изменениям в «правилах игры» (например, если вуз изменит критерии рейтинга), переобучившись на новых данных или с новой функцией вознаграждения, а также агент может находить неочевидные, но эффективные стратегии.

Однако существуют и ограничения. Сложность формализации «рейтинга», моделирование точной функции вознаграждения и риск того, что преподаватели будут «играть в систему», фокусируясь на формальных показателях. Перспективы развития включают расширение пространства состояний и действий, использование более сложных RL-алгоритмов (например, DQN) и интеграцию с реальными данными.

Выводы

В статье представлена концепция применения обучения с подкреплением для разработки рекомендательной системы по оптимизации стратегии профессионального развития преподавателя. Была описана формализация задачи в терминах RL, выбран алгоритм Q-learning и продемонстрирована его работа на примере простой имитационной модели.

Результаты моделирования показывают, что RL-агенты способны вырабатывать осмысленные стратегии поведения даже в упрощенных условиях. Предложенный подход открывает перспективы для создания персонализированных интеллектуальных ассистентов, помогающих преподавателям эффективно строить свою профессиональную траекторию.

Литература

  1. Временное положение о рейтинговой оценке деятельности научно-педагогических работников и кафедр федерального государственного бюджетного образовательного учреждения высшего образования «Донецкий национальный технический университет» [Электронный ресурс]. – Режим доступа: https://donntu.ru/sites/default/files/documents/vremennoe_polozhenie_o_reytinge_2019.pdf, дата обращения 10.05.2025.
  2. Саттон, Р. С., Барто, Э. Г. Обучение с подкреплением. Введение. – 2-е изд. – М.: ДМК Пресс, 2020. – 552 с.
  3. Киселёв Д.С., Федяев О.И. Моделирование процесса управления автономным роботом на основе обучения с подкреплением / Д. С. Киселёв, О. И. Федяев // Программная инженерия: методы и технологии разработки информационно-вычислительных систем (ПИИВС–2024) : V Междунар. науч.-практ. конф., сб. материалов и докладов, Т. 2 : Студ. секция, г. Донецк, 27–28 нояб. 2024 г. – Донецк : ФГБОУ ВО «ДонНТУ», 2024. – С. 236-240.
  4. Goodfellow, I., Bengio, Y., & Courville, A. Deep learning. MIT press, 2016.