ДонНТУ Портал магистров

SOFT ACTOR-CRITIC: OFF-POLICY АЛГОРИТМ С МАКСИМИЗАЦИЕЙ ЭНТРОПИИ

Авторы оригинала: Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel, Sergey Levine (UC Berkeley)
Перевод: Киселёв Д.С.
Источник: ICML (2018)

Аннотация

Безмодельные алгоритмы глубокого обучения с подкреплением (model-free deep RL) часто страдают от высокой дисперсии и низкой эффективности использования данных (sample efficiency). В этой статье мы представляем Soft Actor-Critic (SAC) — off-policy алгоритм актор-критик, основанный на принципе максимизации энтропии. Агент стремится максимизировать не только ожидаемую награду, но и энтропию своей политики.

Введение и Проблема

Существующие методы (такие как DDPG или TRPO) часто либо нестабильны, либо требуют огромного количества взаимодействий со средой. Одной из причин является преждевременная сходимость к субоптимальным детерминированным политикам. Мы предлагаем использовать стохастическую политику и стимулировать её случайность (энтропию).

Формулировка задачи: Максимизация энтропии

Стандартная цель RL — максимизировать сумму наград \(\sum \mathbb{E}[r_t]\). В SAC мы изменяем цель:

\[ J(\pi) = \sum_{t=0}^T \mathbb{E}_{(s_t, a_t) \sim \rho_\pi} [r(s_t, a_t) + \alpha \mathcal{H}(\pi(\cdot|s_t))] \]

Где \(\mathcal{H}\) — энтропия (мера неопределенности), а \(\alpha\) — температурный параметр, регулирующий важность энтропии по сравнению с наградой. Это поощряет агента исследовать среду (exploration) и делает политику более устойчивой к ошибкам в оценке Q-функции.

Алгоритм SAC

SAC использует три сети:

Обучение происходит путем минимизации Soft Bellman Residual. В отличие от DDPG, SAC обучается находить стохастическую политику (обычно гауссову), что существенно повышает стабильность.

Результаты

Мы протестировали SAC на сложных задачах непрерывного управления (Humanoid, Ant) в среде MuJoCo. SAC показал значительно лучшую эффективность по данным (sample efficiency) и асимптотическую производительность по сравнению с DDPG, PPO и TD3. Кроме того, он оказался устойчив к изменению гиперпараметров.

Список литературы (избранное)

  1. Lillicrap, T. P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971.
  2. Ziebart, B. D., et al. (2008). Maximum entropy inverse reinforcement learning. AAAI.
  3. Fujimoto, S., et al. (2018). Addressing function approximation error in actor-critic methods. ICML.