АЛГОРИТМЫ PROXIMAL POLICY OPTIMIZATION (PPO)
Авторы оригинала: John Schulman, Filip Wolski, Prafulla
Dhariwal и др. (OpenAI)
Перевод: Киселёв Д.С.
Источник:
arXiv:1707.06347 (2017)
Аннотация
Мы предлагаем новый класс алгоритмов обучения с подкреплением, называемый Proximal Policy Optimization (PPO). Данный метод чередует сбор данных путем взаимодействия со средой и оптимизацию "суррогатной" целевой функции с использованием стохастического градиентного спуска. PPO сохраняет преимущества методов Trust Region Policy Optimization (TRPO), но значительно проще в реализации, более общий и обладает лучшей выборочной эффективностью.
Введение
В последние годы методы Policy Gradient (градиент политики) стали популярны для решения задач с непрерывным управлением. Однако они чувствительны к выбору размера шага обучения. Слишком большой шаг может привести к катастрофическому падению производительности, из которого агент не сможет восстановиться. TRPO решает эту проблему, накладывая ограничение на KL-дивергенцию, но он сложен вычислительно.
Метод: Клиппированная целевая функция
Обозначим отношение вероятностей как \(r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}\). Основным нововведением PPO является следующая целевая функция:
\[ L^{CLIP}(\theta) = \hat{\mathbb{E}}_t [ \min(r_t(\theta)\hat{A}_t, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t) ] \]
Где:
- \(\hat{A}_t\) — оценка функции преимущества (Advantage).
- \(\epsilon\) — гиперпараметр (например, 0.2).
Операция \( \text{clip} \) ограничивает отношение \(r_t(\theta)\) диапазоном \([1-\epsilon, 1+\epsilon]\). Это эффективно предотвращает слишком резкие изменения политики, "пессимистично" оценивая градиент. Если изменение политики слишком велико, целевая функция перестает расти, и градиент становится нулевым.
Сравнение и Результаты
Мы сравнили PPO с другими алгоритмами (A2C, ACER, TRPO) на задачах из набора MuJoCo (непрерывное управление роботами). PPO показал превосходство в стабильности и итоговом вознаграждении. Алгоритм также был протестирован на играх Atari, где он также показал конкурентоспособные результаты при меньшей сложности настройки.
Заключение
PPO обеспечивает баланс между простотой реализации, скоростью обучения и надежностью. Благодаря этому он стал алгоритмом по умолчанию в библиотеке OpenAI Baselines и широко используется в сообществе.
Список литературы (избранное)
- Schulman, J., et al. (2015). Trust region policy optimization. ICML.
- Mnih, V., et al. (2016). Asynchronous methods for deep reinforcement learning. ICML.
- Schulman, J., et al. (2016). High-dimensional continuous control using generalized advantage estimation. ICLR.