Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL

About

We present a novel Diffusion Offline Multi-agent Model (DOM2) for offline Multi-Agent Reinforcement Learning (MARL). Different from existing algorithms that rely mainly on conservatism in policy design, DOM2 enhances policy expressiveness and diversity based on diffusion model. Specifically, we incorporate a diffusion model into the policy network and propose a trajectory-based data-reweighting scheme in training. These key ingredients significantly improve algorithm robustness against environment changes and achieve significant improvements in performance, generalization and data-efficiency. Our extensive experimental results demonstrate that DOM2 outperforms existing state-of-the-art methods in all multi-agent particle and multi-agent MuJoCo environments, and generalizes significantly better to shifted environments {(in $28$ out of $30$ settings evaluated)} thanks to its high expressiveness and diversity. Moreover, DOM2 is ultra data efficient and requires no more than $5\%$ data for achieving the same performance compared to existing algorithms (a $20\times$ improvement in data efficiency).

Zhuoran Li, Ling Pan, Jiatai Huang, Longbo Huang• 2023

Related benchmarks

TaskDatasetResultRank
Multi-Agent Reinforcement LearningMAMuJoCo HalfCheetah Standard Env v2 (various)
Average Return3.68e+3
24
Multi-Agent Reinforcement LearningMAMuJoCo HalfCheetah Random Env v2 (various)
Average Return3.18e+3
24
Multi-Agent Reinforcement LearningMAMuJoCo HalfCheetah Extreme Env v2 (various)
Average Return2.64e+3
24
Multi-Agent Reinforcement LearningMPE Predator Prey Medium
Mean Episode Return155.8
19
Multi-Agent Reinforcement LearningMPE Predator Prey (Expert)
Mean Episode Return259.1
19
Multi-Agent Reinforcement LearningMPE Predator Prey (Random)
Mean Episode Return208.7
15
Multi-Agent Reinforcement LearningMPE Predator Prey (Medium Replay)
Mean Episode Return150.5
15
3-Agent 6-Landmark3-Agent 6-Landmark Random
Mean Episode Return470
12
3-Agent 6-Landmark3-Agent 6-Landmark Random Medium
Mean Episode Return329.9
12
3-Agent 6-Landmark3-Agent 6-Landmark Medium Replay
Mean Episode Return542.4
12
Showing 10 of 38 rows

Other info

Follow for update