ДонНТУ Портал магистров

МУЛЬТИАГЕНТНЫЙ АКТЕР-КРИТИК ДЛЯ СМЕШАННЫХ КООПЕРАТИВНО-КОНКУРЕНТНЫХ СРЕД

Авторы оригинала: Ryan Lowe, Yi Wu, Aviv Tamar и др. (OpenAI)
Перевод: Киселёв Д.С.
Источник: NIPS (2017)

Аннотация

Мы представляем адаптацию алгоритмов actor-critic для мультиагентных сред. Мы рассматриваем метод "централизованное обучение, децентрализованное исполнение", позволяющий агентам использовать дополнительную информацию во время обучения, но действовать автономно. Наш алгоритм, Multi-Agent Deep Deterministic Policy Gradient (MADDPG), демонстрирует способность обучать агентов сложным стратегиям взаимодействия (как кооперации, так и конкуренции).

Проблема нестационарности

Традиционные алгоритмы RL (такие как Q-learning) плохо работают в мультиагентных системах, потому что с точки зрения одного агента, окружающая среда является нестационарной (non-stationary). Пока агент учится, другие агенты тоже меняют свои политики. Это нарушает марковское свойство, необходимое для сходимости.

Метод: MADDPG

Мы расширяем алгоритм DDPG. Основная идея заключается в использовании централизованного критика (Critic). Для каждого агента \(i\) критик \(Q_i^\pi\) получает на вход не только действия и состояния самого агента, но и действия и наблюдения всех остальных агентов: \( (x, a_1, \dots, a_N) \).

Градиент для обновления политики агента \(i\) выглядит так:

\[ \nabla_{\theta_i} J \approx \mathbb{E} [ \nabla_{\theta_i} \mu_i(o_i) \nabla_{a_i} Q_i^\pi(x, a_1, \dots, a_N) |_{a_i=\mu_i(o_i)} ] \]

Критик используется только во время обучения. Во время исполнения (execution) используется только сеть актера \(\mu_i(o_i)\), которая зависит только от локальных наблюдений \(o_i\). Это снимает требование связи между агентами в реальном времени.

Результаты

Мы протестировали MADDPG в среде Multi-Agent Particle Environments (MPE). Сценарии включали: "Хищник-Жертва" (кооперативная охота), "Кооперативная навигация" и "Физический обман". В сравнении с независимым DDPG (где каждый агент учится сам по себе), MADDPG показал значительно более скоординированное поведение и стабильную сходимость.

Заключение

MADDPG предоставляет надежный фреймворк для обучения агентов в сложных социальных средах. Подход с централизованным критиком позволяет стабилизировать обучение, не нарушая ограничений на децентрализованное управление.

Список литературы (избранное)

  1. Lillicrap, T. P., et al. (2015). Continuous control with deep reinforcement learning. ICLR.
  2. Foerster, J., et al. (2016). Learning to communicate with deep multi-agent reinforcement learning. NIPS.
  3. Silver, D., et al. (2014). Deterministic policy gradient algorithms. ICML.