Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Continuous Simulation Setting

Benchmarks

Task NameDataset NameSOTA ResultTrend
Optimal Policy EstimationContinuous Simulation Setting epsilon = 0.9
Mean Regret0.06
3
Optimal Policy EstimationContinuous Simulation Setting epsilon = 0.7
Mean Regret0.1
3
Optimal Policy EstimationContinuous Simulation Setting (epsilon = 0.5)
Mean Regret0.11
3
Showing 3 of 3 rows