Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Offline Safe Reinforcement Learning on DSRL Mean
Loading...
270.45
Reward
CDCP
-13.5428
60.1861
133.915
207.6439
Jul 4, 2026
Reward
Cost
Updated 19d ago
Evaluation Results
Method
Method
Links
Reward
Cost
CDCP
Mode=Multi-task
2026.07
270.45
23.06
MTCOptiDICE
Mode=Multi-task
2026.07
178.34
39.79
MTCDT
Mode=Multi-task
2026.07
108.33
22.24
MTCPQ
Mode=Multi-task
2026.07
-2.62
0.62
Feedback
Search any
task
Search any
task