Improving Generalization and Data Efficiency with Diffusion in Offline Multi-agent RL
About
We present a novel Diffusion Offline Multi-agent Model (DOM2) for offline Multi-Agent Reinforcement Learning (MARL). Different from existing algorithms that rely mainly on conservatism in policy design, DOM2 enhances policy expressiveness and diversity based on diffusion model. Specifically, we incorporate a diffusion model into the policy network and propose a trajectory-based data-reweighting scheme in training. These key ingredients significantly improve algorithm robustness against environment changes and achieve significant improvements in performance, generalization and data-efficiency. Our extensive experimental results demonstrate that DOM2 outperforms existing state-of-the-art methods in all multi-agent particle and multi-agent MuJoCo environments, and generalizes significantly better to shifted environments {(in $28$ out of $30$ settings evaluated)} thanks to its high expressiveness and diversity. Moreover, DOM2 is ultra data efficient and requires no more than $5\%$ data for achieving the same performance compared to existing algorithms (a $20\times$ improvement in data efficiency).
Related benchmarks
| Task | Dataset | Result | Rank | |
|---|---|---|---|---|
| Multi-Agent Reinforcement Learning | MAMuJoCo HalfCheetah Standard Env v2 (various) | Average Return3.68e+3 | 24 | |
| Multi-Agent Reinforcement Learning | MAMuJoCo HalfCheetah Random Env v2 (various) | Average Return3.18e+3 | 24 | |
| Multi-Agent Reinforcement Learning | MAMuJoCo HalfCheetah Extreme Env v2 (various) | Average Return2.64e+3 | 24 | |
| Multi-Agent Reinforcement Learning | MPE Predator Prey Medium | Mean Episode Return155.8 | 19 | |
| Multi-Agent Reinforcement Learning | MPE Predator Prey (Expert) | Mean Episode Return259.1 | 19 | |
| Multi-Agent Reinforcement Learning | MPE Predator Prey (Random) | Mean Episode Return208.7 | 15 | |
| Multi-Agent Reinforcement Learning | MPE Predator Prey (Medium Replay) | Mean Episode Return150.5 | 15 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Random | Mean Episode Return470 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Random Medium | Mean Episode Return329.9 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Medium Replay | Mean Episode Return542.4 | 12 |