Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Offline Safe Reinforcement Learning on DSRL HardMean
Loading...
253.58
Reward
CDCP
-12.8056
56.3522
125.51
194.6678
Jul 4, 2026
Reward
Cost
Updated 19d ago
Evaluation Results
Method
Method
Links
Reward
Cost
CDCP
Mode=Multi-task
2026.07
253.58
24.78
MTCOptiDICE
Mode=Multi-task
2026.07
154.22
33.76
MTCDT
Mode=Multi-task
2026.07
87.88
18.14
MTCPQ
Mode=Multi-task
2026.07
-2.56
0.33
Feedback
Search any
task
Search any
task