SOFT ACTOR-CRITIC: OFF-POLICY АЛГОРИТМ С МАКСИМИЗАЦИЕЙ ЭНТРОПИИ
Авторы оригинала: Tuomas Haarnoja, Aurick Zhou, Pieter Abbeel,
Sergey Levine (UC Berkeley)
Перевод: Киселёв Д.С.
Источник:
ICML (2018)
Аннотация
Безмодельные алгоритмы глубокого обучения с подкреплением (model-free deep RL) часто страдают от высокой дисперсии и низкой эффективности использования данных (sample efficiency). В этой статье мы представляем Soft Actor-Critic (SAC) — off-policy алгоритм актор-критик, основанный на принципе максимизации энтропии. Агент стремится максимизировать не только ожидаемую награду, но и энтропию своей политики.
Введение и Проблема
Существующие методы (такие как DDPG или TRPO) часто либо нестабильны, либо требуют огромного количества взаимодействий со средой. Одной из причин является преждевременная сходимость к субоптимальным детерминированным политикам. Мы предлагаем использовать стохастическую политику и стимулировать её случайность (энтропию).
Формулировка задачи: Максимизация энтропии
Стандартная цель RL — максимизировать сумму наград \(\sum \mathbb{E}[r_t]\). В SAC мы изменяем цель:
\[ J(\pi) = \sum_{t=0}^T \mathbb{E}_{(s_t, a_t) \sim \rho_\pi} [r(s_t, a_t) + \alpha \mathcal{H}(\pi(\cdot|s_t))] \]
Где \(\mathcal{H}\) — энтропия (мера неопределенности), а \(\alpha\) — температурный параметр, регулирующий важность энтропии по сравнению с наградой. Это поощряет агента исследовать среду (exploration) и делает политику более устойчивой к ошибкам в оценке Q-функции.
Алгоритм SAC
SAC использует три сети:
- V-функцию (soft state value function).
- Q-функцию (soft Q-function) — обычно две для борьбы с переоценкой.
- Политику \(\pi\) (policy network).
Обучение происходит путем минимизации Soft Bellman Residual. В отличие от DDPG, SAC обучается находить стохастическую политику (обычно гауссову), что существенно повышает стабильность.
Результаты
Мы протестировали SAC на сложных задачах непрерывного управления (Humanoid, Ant) в среде MuJoCo. SAC показал значительно лучшую эффективность по данным (sample efficiency) и асимптотическую производительность по сравнению с DDPG, PPO и TD3. Кроме того, он оказался устойчив к изменению гиперпараметров.
Список литературы (избранное)
- Lillicrap, T. P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971.
- Ziebart, B. D., et al. (2008). Maximum entropy inverse reinforcement learning. AAAI.
- Fujimoto, S., et al. (2018). Addressing function approximation error in actor-critic methods. ICML.