МУЛЬТИАГЕНТНЫЙ АКТЕР-КРИТИК ДЛЯ СМЕШАННЫХ КООПЕРАТИВНО-КОНКУРЕНТНЫХ СРЕД
Авторы оригинала: Ryan Lowe, Yi Wu, Aviv Tamar и др.
(OpenAI)
Перевод: Киселёв Д.С.
Источник:
NIPS (2017)
Аннотация
Мы представляем адаптацию алгоритмов actor-critic для мультиагентных сред. Мы рассматриваем метод "централизованное обучение, децентрализованное исполнение", позволяющий агентам использовать дополнительную информацию во время обучения, но действовать автономно. Наш алгоритм, Multi-Agent Deep Deterministic Policy Gradient (MADDPG), демонстрирует способность обучать агентов сложным стратегиям взаимодействия (как кооперации, так и конкуренции).
Проблема нестационарности
Традиционные алгоритмы RL (такие как Q-learning) плохо работают в мультиагентных системах, потому что с точки зрения одного агента, окружающая среда является нестационарной (non-stationary). Пока агент учится, другие агенты тоже меняют свои политики. Это нарушает марковское свойство, необходимое для сходимости.
Метод: MADDPG
Мы расширяем алгоритм DDPG. Основная идея заключается в использовании централизованного критика (Critic). Для каждого агента \(i\) критик \(Q_i^\pi\) получает на вход не только действия и состояния самого агента, но и действия и наблюдения всех остальных агентов: \( (x, a_1, \dots, a_N) \).
Градиент для обновления политики агента \(i\) выглядит так:
\[ \nabla_{\theta_i} J \approx \mathbb{E} [ \nabla_{\theta_i} \mu_i(o_i) \nabla_{a_i} Q_i^\pi(x, a_1, \dots, a_N) |_{a_i=\mu_i(o_i)} ] \]
Критик используется только во время обучения. Во время исполнения (execution) используется только сеть актера \(\mu_i(o_i)\), которая зависит только от локальных наблюдений \(o_i\). Это снимает требование связи между агентами в реальном времени.
Результаты
Мы протестировали MADDPG в среде Multi-Agent Particle Environments (MPE). Сценарии включали: "Хищник-Жертва" (кооперативная охота), "Кооперативная навигация" и "Физический обман". В сравнении с независимым DDPG (где каждый агент учится сам по себе), MADDPG показал значительно более скоординированное поведение и стабильную сходимость.
Заключение
MADDPG предоставляет надежный фреймворк для обучения агентов в сложных социальных средах. Подход с централизованным критиком позволяет стабилизировать обучение, не нарушая ограничений на децентрализованное управление.
Список литературы (избранное)
- Lillicrap, T. P., et al. (2015). Continuous control with deep reinforcement learning. ICLR.
- Foerster, J., et al. (2016). Learning to communicate with deep multi-agent reinforcement learning. NIPS.
- Silver, D., et al. (2014). Deterministic policy gradient algorithms. ICML.