| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Optimal Policy Estimation | Continuous Simulation Setting epsilon = 0.9 | Mean Regret0.06 | 3 | |
| Optimal Policy Estimation | Continuous Simulation Setting epsilon = 0.7 | Mean Regret0.1 | 3 | |
| Optimal Policy Estimation | Continuous Simulation Setting (epsilon = 0.5) | Mean Regret0.11 | 3 |