УРОВЕНЬ ЧЕЛОВЕЧЕСКОГО КОНТРОЛЯ С ПОМОЩЬЮ ГЛУБОКОГО ОБУЧЕНИЯ С ПОДКРЕПЛЕНИЕМ
Авторы оригинала: Volodymyr Mnih, Koray Kavukcuoglu, David
Silver и др. (DeepMind)
Перевод: Киселёв Д.С.
Источник:
Nature, 518(7540), 529-533 (2015)
Аннотация
Теория обучения с подкреплением обещает создание автономных агентов, способных обучаться в сложных средах. Однако ранее такие агенты были ограничены задачами с малой размерностью пространства состояний. В данной работе мы представляем искусственный агент, названный Deep Q-Network (DQN), который может обучаться стратегиям управления непосредственно из высокоразмерного сенсорного ввода (видеопотока), используя глубокие нейронные сети. Агент превзошел профессиональных игроков-людей в наборе из 49 игр Atari 2600.
Введение
Целью искусственного интеллекта является создание систем, способных решать разнообразные задачи в сложных условиях. В последние годы глубокое обучение позволило достичь прорывов в распознавании образов. Однако применение этих методов в обучении с подкреплением (RL) сталкивается с проблемами: данные в RL не являются независимыми и одинаково распределенными (i.i.d.), они сильно коррелированы, а распределение данных меняется по мере обучения агента.
Методология: Deep Q-Network
Мы используем глубокую сверточную нейронную сеть для аппроксимации оптимальной функции ценности действия:
\[ Q^*(s, a) = \max_\pi \mathbb{E} [ r_t + \gamma r_{t+1} + \gamma^2 r_{t+2} + \dots | s_t = s, a_t = a, \pi ] \]
которая подчиняется уравнению Беллмана:
\[ Q^*(s, a) = \mathbb{E}_{s'} [ r + \gamma \max_{a'} Q^*(s', a') | s, a ] \]
Для стабилизации обучения мы внедрили два ключевых механизма:
- Experience Replay (Воспроизведение опыта): Агент сохраняет свои переходы \((s_t, a_t, r_t, s_{t+1})\) в буфер. При обучении мы выбираем случайные мини-батчи из буфера, что разрушает временную корреляцию данных и приближает их распределение к i.i.d.
- Target Network (Целевая сеть): Для вычисления целевого значения \(y_j = r_j + \gamma \max_{a'} \hat{Q}(s_{j+1}, a'; \theta^-)\) используется отдельная сеть с параметрами \(\theta^-\), которые обновляются лишь периодически. Это предотвращает осцилляции.
Результаты эксперимента
Мы применили одну и ту же архитектуру сети и гиперпараметры ко всем 49 играм. Входными данными служили только пиксели экрана и игровой счет. В большинстве игр (Video Pinball, Boxing, Breakout и др.) DQN показал результаты, значительно превосходящие существующие алгоритмы и уровень человека-эксперта. Например, в игре Breakout агент научился стратегии прорывания туннеля для отправки мяча за стену кирпичей.
Заключение
Данная работа демонстрирует, что глубокая сверточная нейронная сеть, обученная с помощью Q-learning с использованием стохастического градиентного спуска, может осваивать сложные задачи управления на основе необработанных видеоданных. Предложенный подход преодолевает проблемы нестабильности, свойственные предыдущим попыткам объединения RL и глубоких сетей.
Список литературы (избранное)
- Sutton, R. S., & Barto, A. G. (1998). Reinforcement learning: An introduction. MIT press.
- Tesauro, G. (1995). Temporal difference learning and TD-Gammon. Communications of the ACM, 38(3), 58-68.
- Riedmiller, M. (2005). Neural fitted Q iteration – first experiences with a data efficient neural reinforcement learning method. ECML.
- Watkins, C. J., & Dayan, P. (1992). Q-learning. Machine learning, 8(3-4), 279-292.