Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Offline Safe Reinforcement Learning on DSRL MediumDense
Loading...
237.75
Reward
CDCP
-13.9924
51.3638
116.72
182.0762
Jul 4, 2026
Reward
Cost
Updated 19d ago
Evaluation Results
Method
Method
Links
Reward
Cost
CDCP
Mode=Multi-task
2026.07
237.75
18.75
MTCOptiDICE
Mode=Multi-task
2026.07
161.13
34.65
MTCDT
Mode=Multi-task
2026.07
69.95
14.68
MTCPQ
Mode=Multi-task
2026.07
-4.31
1.21
Feedback
Search any
task
Search any
task