Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

DSRL

Benchmarks

Task NameDataset NameSOTA ResultTrend
Safe Reinforcement LearningDSRL EasyMean
Reward324.41
7
Constrained Offline Reinforcement LearningDSRL CarCircle1
Normalized Return0.73
7
Constrained Offline Reinforcement LearningDSRL CarGoal1
Normalized Return0.79
7
Constrained Offline Reinforcement LearningDSRL PointCircle1
Normalized Return0.86
7
Constrained Offline Reinforcement LearningDSRL PointGoal1
Normalized Return0.74
7
Constrained Offline Reinforcement LearningDSRL HalfCheetahVelocity
Normalized Return105
7
Constrained Offline Reinforcement LearningDSRL Walker2dVelocity
Normalized Return0.8
7
Constrained Offline Reinforcement LearningDSRL HopperVelocity
Normalized Return0.81
7
Offline Safe Reinforcement LearningDSRL Mean
Reward270.45
4
Offline Safe Reinforcement LearningDSRL HardDense
Reward243.63
4
Offline Safe Reinforcement LearningDSRL HardMean
Reward253.58
4
Offline Safe Reinforcement LearningDSRL HardSparse
Reward257.98
4
Offline Safe Reinforcement LearningDSRL MediumDense
Reward237.75
4
Offline Safe Reinforcement LearningDSRL MediumMean
Reward236.57
4
Offline Safe Reinforcement LearningDSRL MediumSparse
Reward242.75
4
Offline Safe Reinforcement LearningDSRL EasyDense
Reward316.47
4
Offline Safe Reinforcement LearningDSRL EasySparse
Reward326.06
4
Safe Reinforcement LearningDSRL Average across 9 tasks
Reward270.45
3
Safe Reinforcement LearningDSRL HardDense
Reward243.63
3
Safe Reinforcement LearningDSRL HardMean
Reward253.58
3
Safe Reinforcement LearningDSRL HardSparse
Reward257.98
3
Safe Reinforcement LearningDSRL MediumDense
Reward237.75
3
Safe Reinforcement LearningDSRL MediumMean
Reward236.57
3
Safe Reinforcement LearningDSRL MediumSparse
Reward242.75
3
Safe Reinforcement LearningDSRL EasyDense
Reward316.47
3
Showing 25 of 26 rows