ДонНТУ Портал магистров

ИССЛЕДОВАНИЕ, УПРАВЛЯЕМОЕ ЛЮБОПЫТСТВОМ, ПУТЕМ САМОКОНТРОЛИРУЕМОГО ПРОГНОЗИРОВАНИЯ

Авторы оригинала: Deepak Pathak, Pulkit Agrawal, Alexei A. Efros, Trevor Darrell (UC Berkeley)
Перевод: Киселёв Д.С.
Источник: ICML (2017)

Аннотация

В многих реальных сценариях внешние награды (rewards) для агента либо очень редки, либо отсутствуют вовсе. В данной работе мы предлагаем Intrinsic Curiosity Module (ICM) — механизм внутренней мотивации, который побуждает агента исследовать состояния, динамику которых он пока не умеет предсказывать. Мы показываем, что агенты, использующие только любопытство, могут освоить сложные навыки (например, играть в Super Mario Bros), даже не получая никаких очков от игры.

Проблема редких наград

Стандартные RL-алгоритмы полагаются на плотный сигнал награды. В среде, где награда дается только в самом конце (например, выход из лабиринте), $\epsilon$-greedy стратегия исследования неэффективна, так как вероятность случайно наткнуться на цель ничтожно мала. Любопытство служит плотным сигналом, направляющим агента.

Метод: Intrinsic Curiosity Module (ICM)

Идея состоит в том, чтобы предсказывать следующее состояние \(s_{t+1}\) на основе текущего \(s_t\) и действия \(a_t\). Однако предсказывать пиксели напрямую сложно и неэффективно (например, движение листвы на ветру не влияет на агента, но создает большую ошибку предсказания).
ICM решает это, обучая пространство признаков (feature space) с помощью инверсной модели: сеть пытается угадать действие \(a_t\), зная \(s_t\) и \(s_{t+1}\). Таким образом, в признаках кодируется только то, на что агент может повлиять.

Награда за любопытство определяется как ошибка предсказания в этом пространстве признаков:

\[ r_t^i = \frac{\eta}{2} \| \hat{\phi}(s_{t+1}) - \phi(s_{t+1}) \|^2 \]

Эксперименты

Мы протестировали метод в играх VizDoom и Super Mario Bros. В VizDoom агент с ICM быстрее исследовал карту и избегал стен. В Super Mario агент, не получая награды за убийство врагов или сбор монет, научился проходить уровни, просто потому что это открывало новые, неизведанные части карты, максимизируя ошибку предсказания (удовлетворяя любопытство).

Заключение

Предложенный механизм обеспечивает надежное исследование среды и позволяет агентам приобретать обобщаемые навыки без явного внешнего подкрепления.

Список литературы (избранное)

  1. Schmidhuber, J. (1991). A possibility for implementing curiosity and boredom in model-building neural controllers. SAB.
  2. Bellemare, M., et al. (2016). Unifying count-based exploration and intrinsic motivation. NIPS.
  3. Mnih, V., et al. (2016). Asynchronous methods for deep reinforcement learning. ICML.