| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Safe Reinforcement Learning | DSRL EasyMean | Reward324.41 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL CarCircle1 | Normalized Return0.73 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL CarGoal1 | Normalized Return0.79 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL PointCircle1 | Normalized Return0.86 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL PointGoal1 | Normalized Return0.74 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL HalfCheetahVelocity | Normalized Return105 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL Walker2dVelocity | Normalized Return0.8 | 7 | |
| Constrained Offline Reinforcement Learning | DSRL HopperVelocity | Normalized Return0.81 | 7 | |
| Offline Safe Reinforcement Learning | DSRL Mean | Reward270.45 | 4 | |
| Offline Safe Reinforcement Learning | DSRL HardDense | Reward243.63 | 4 | |
| Offline Safe Reinforcement Learning | DSRL HardMean | Reward253.58 | 4 | |
| Offline Safe Reinforcement Learning | DSRL HardSparse | Reward257.98 | 4 | |
| Offline Safe Reinforcement Learning | DSRL MediumDense | Reward237.75 | 4 | |
| Offline Safe Reinforcement Learning | DSRL MediumMean | Reward236.57 | 4 | |
| Offline Safe Reinforcement Learning | DSRL MediumSparse | Reward242.75 | 4 | |
| Offline Safe Reinforcement Learning | DSRL EasyDense | Reward316.47 | 4 | |
| Offline Safe Reinforcement Learning | DSRL EasySparse | Reward326.06 | 4 | |
| Safe Reinforcement Learning | DSRL Average across 9 tasks | Reward270.45 | 3 | |
| Safe Reinforcement Learning | DSRL HardDense | Reward243.63 | 3 | |
| Safe Reinforcement Learning | DSRL HardMean | Reward253.58 | 3 | |
| Safe Reinforcement Learning | DSRL HardSparse | Reward257.98 | 3 | |
| Safe Reinforcement Learning | DSRL MediumDense | Reward237.75 | 3 | |
| Safe Reinforcement Learning | DSRL MediumMean | Reward236.57 | 3 | |
| Safe Reinforcement Learning | DSRL MediumSparse | Reward242.75 | 3 | |
| Safe Reinforcement Learning | DSRL EasyDense | Reward316.47 | 3 |