ДонНТУ Портал магистров

УРОВЕНЬ ЧЕЛОВЕЧЕСКОГО КОНТРОЛЯ С ПОМОЩЬЮ ГЛУБОКОГО ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ

Авторы оригинала: Volodymyr Mnih, Koray Kavukcuoglu, David Silver и др. (DeepMind)
Перевод: Киселёв Д.С.
Источник: Nature, 518(7540), 529-533 (2015)

Аннотация

Теория обучения с подкреплением обещает создание автономных агентов, способных обучаться в сложных средах. Однако ранее такие агенты были ограничены задачами с малой размерностью пространства состояний. В данной работе мы представляем искусственный агент, названный Deep Q-Network (DQN), который может обучаться стратегиям управления непосредственно из высокоразмерного сенсорного ввода (видеопотока), используя глубокие нейронные сети. Агент превзошел профессиональных игроков-людей в наборе из 49 игр Atari 2600.

Введение

Целью искусственного интеллекта является создание систем, способных решать разнообразные задачи в сложных условиях. В последние годы глубокое обучение позволило достичь прорывов в распознавании образов. Однако применение этих методов в обучении с подкреплением (RL) сталкивается с проблемами: данные в RL не являются независимыми и одинаково распределенными (i.i.d.), они сильно коррелированы, а распределение данных меняется по мере обучения агента.

Методология: Deep Q-Network

Мы используем глубокую сверточную нейронную сеть для аппроксимации оптимальной функции ценности действия:

\[ Q^*(s, a) = \max_\pi \mathbb{E} [ r_t + \gamma r_{t+1} + \gamma^2 r_{t+2} + \dots | s_t = s, a_t = a, \pi ] \]

которая подчиняется уравнению Беллмана:

\[ Q^*(s, a) = \mathbb{E}_{s'} [ r + \gamma \max_{a'} Q^*(s', a') | s, a ] \]

Для стабилизации обучения мы внедрили два ключевых механизма:

  1. Experience Replay (Воспроизведение опыта): Агент сохраняет свои переходы \((s_t, a_t, r_t, s_{t+1})\) в буфер. При обучении мы выбираем случайные мини-батчи из буфера, что разрушает временную корреляцию данных и приближает их распределение к i.i.d.
  2. Target Network (Целевая сеть): Для вычисления целевого значения \(y_j = r_j + \gamma \max_{a'} \hat{Q}(s_{j+1}, a'; \theta^-)\) используется отдельная сеть с параметрами \(\theta^-\), которые обновляются лишь периодически. Это предотвращает осцилляции.

Результаты эксперимента

Мы применили одну и ту же архитектуру сети и гиперпараметры ко всем 49 играм. Входными данными служили только пиксели экрана и игровой счет. В большинстве игр (Video Pinball, Boxing, Breakout и др.) DQN показал результаты, значительно превосходящие существующие алгоритмы и уровень человека-эксперта. Например, в игре Breakout агент научился стратегии прорывания туннеля для отправки мяча за стену кирпичей.

Заключение

Данная работа демонстрирует, что глубокая сверточная нейронная сеть, обученная с помощью Q-learning с использованием стохастического градиентного спуска, может осваивать сложные задачи управления на основе необработанных видеоданных. Предложенный подход преодолевает проблемы нестабильности, свойственные предыдущим попыткам объединения RL и глубоких сетей.

Список литературы (избранное)

  1. Sutton, R. S., & Barto, A. G. (1998). Reinforcement learning: An introduction. MIT press.
  2. Tesauro, G. (1995). Temporal difference learning and TD-Gammon. Communications of the ACM, 38(3), 58-68.
  3. Riedmiller, M. (2005). Neural fitted Q iteration – first experiences with a data efficient neural reinforcement learning method. ECML.
  4. Watkins, C. J., & Dayan, P. (1992). Q-learning. Machine learning, 8(3-4), 279-292.