Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Offline Safe Reinforcement Learning on DSRL MediumMean
Loading...
236.57
Reward
CDCP
-13.9452
51.0924
116.13
181.1676
Jul 4, 2026
Reward
Cost
Updated 19d ago
Evaluation Results
Method
Method
Links
Reward
Cost
CDCP
Mode=Multi-task
2026.07
236.57
19.65
MTCOptiDICE
Mode=Multi-task
2026.07
173.61
37.42
MTCDT
Mode=Multi-task
2026.07
72.95
15.31
MTCPQ
Mode=Multi-task
2026.07
-4.31
1.21
Feedback
Search any
task
Search any
task