| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Expert | Mean Episode Return683.3 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Medium Expert | Mean Episode Return678.7 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Medium | Mean Episode Return532.5 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Medium Replay | Mean Episode Return542.4 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Random Medium | Mean Episode Return329.9 | 12 | |
| 3-Agent 6-Landmark | 3-Agent 6-Landmark Random | Mean Episode Return470 | 12 | |
| Multi-Agent Navigation | 3-Agent 6-Landmark Standard Environment (Random Medium) | Number of good policies13 | 8 | |
| Multi-Agent Navigation | 3-Agent 6-Landmark Standard Environment (Expert) | Number of Good Policies20 | 4 | |
| Multi-Agent Navigation | 3-Agent 6-Landmark Medium Expert Standard Environment | Number of Good Policies19.2 | 4 | |
| Multi-Agent Navigation | 3-Agent 6-Landmark Standard Environment Medium Replay | Number of Good Policies14.6 | 4 | |
| Multi-Agent Navigation | 3-Agent 6-Landmark Standard Environment (Random) | Number of Good Policies12.8 | 4 |