ДонНТУ Портал магистров

АЛГОРИТМЫ PROXIMAL POLICY OPTIMIZATION (PPO)

Авторы оригинала: John Schulman, Filip Wolski, Prafulla Dhariwal и др. (OpenAI)
Перевод: Киселёв Д.С.
Источник: arXiv:1707.06347 (2017)

Аннотация

Мы предлагаем новый класс алгоритмов обучения с подкреплением, называемый Proximal Policy Optimization (PPO). Данный метод чередует сбор данных путем взаимодействия со средой и оптимизацию "суррогатной" целевой функции с использованием стохастического градиентного спуска. PPO сохраняет преимущества методов Trust Region Policy Optimization (TRPO), но значительно проще в реализации, более общий и обладает лучшей выборочной эффективностью.

Введение

В последние годы методы Policy Gradient (градиент политики) стали популярны для решения задач с непрерывным управлением. Однако они чувствительны к выбору размера шага обучения. Слишком большой шаг может привести к катастрофическому падению производительности, из которого агент не сможет восстановиться. TRPO решает эту проблему, накладывая ограничение на KL-дивергенцию, но он сложен вычислительно.

Метод: Клиппированная целевая функция

Обозначим отношение вероятностей как \(r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}\). Основным нововведением PPO является следующая целевая функция:

\[ L^{CLIP}(\theta) = \hat{\mathbb{E}}_t [ \min(r_t(\theta)\hat{A}_t, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t) ] \]

Где:

Операция \( \text{clip} \) ограничивает отношение \(r_t(\theta)\) диапазоном \([1-\epsilon, 1+\epsilon]\). Это эффективно предотвращает слишком резкие изменения политики, "пессимистично" оценивая градиент. Если изменение политики слишком велико, целевая функция перестает расти, и градиент становится нулевым.

Сравнение и Результаты

Мы сравнили PPO с другими алгоритмами (A2C, ACER, TRPO) на задачах из набора MuJoCo (непрерывное управление роботами). PPO показал превосходство в стабильности и итоговом вознаграждении. Алгоритм также был протестирован на играх Atari, где он также показал конкурентоспособные результаты при меньшей сложности настройки.

Заключение

PPO обеспечивает баланс между простотой реализации, скоростью обучения и надежностью. Благодаря этому он стал алгоритмом по умолчанию в библиотеке OpenAI Baselines и широко используется в сообществе.

Список литературы (избранное)

  1. Schulman, J., et al. (2015). Trust region policy optimization. ICML.
  2. Mnih, V., et al. (2016). Asynchronous methods for deep reinforcement learning. ICML.
  3. Schulman, J., et al. (2016). High-dimensional continuous control using generalized advantage estimation. ICLR.