| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| RockSample (8, 4, 10, -1) | Average Reward16.7 | 30 | 2mo ago | ||
| RockSample (7, 8, 20, 0) | Average Reward28.5 | 30 | 2mo ago | ||
| Tag | Average Reward-2.3 | 30 | 2mo ago | ||
| ALFWorld (test) | SMaRT | Success Rate96.27 | 26 | 4mo ago | |
| HotPotQA | Average Steps per Episode4.7 | 18 | 4mo ago | ||
| WebShop | SYMPHONY-L | Score0.88 | 11 | 4mo ago | |
| Jericho ID (meta-train) | META-TTL | Score (Detective)270.5 | 9 | 3mo ago | |
| FrozenLake (val) | EVPO | Success Rate68.4 | 6 | 3mo ago | |
| Sokoban (val) | EVPO | Success Rate60.4 | 6 | 3mo ago | |
| ALFWorld-C | LWM-Planner | Cumulative Return19.5 | 5 | 1mo ago | |
| ALFWorld-B | LWM-Planner | Cumulative Return22.89 | 5 | 1mo ago | |
| ALFWorld-A | LWM-Planner | Cumulative Return21.33 | 5 | 1mo ago | |
| CrafterMini 5x5 | LWM-Planner | Cumulative Return150.3 | 5 | 1mo ago | |
| TextFrozenLake 4x4; h=0.9 | LWM-Planner | Cumulative Return31.8 | 5 | 1mo ago | |
| ALFWorld (134 evaluation tasks) | LWM-Planner | Normalized Success Rate71.5 | 5 | 1mo ago | |
| ScienceWorld | AutoRefine | Pass@1 Success Rate70.4 | 4 | 4mo ago | |
| WebShop (post-training evaluation) | Rollout Length14.8 | 3 | 24d ago | ||
| ALFWorld (post-training evaluation) | Rollout Length43.9 | 3 | 24d ago | ||
| MiniGrid DoorKey-8x8 (100 episodes) | Factive | Success Rate89 | 3 | 1mo ago | |
| COMPAS | OFS-Grid | Reward0.7556 | 3 | 4mo ago | |
| German tail mean over the last 200 iterations | OFS-Grid | Reward0.4546 | 3 | 4mo ago | |
| MVE-S tail mean over the last 200 iterations | OFS-Grid | Reward0.3068 | 3 | 4mo ago | |
| 50 simulated datasets (T=20) | SUPER | Mean Regret3.54 | 2 | 1mo ago | |
| 50 simulated datasets T=10 | SUPER | Mean Regret0.697 | 2 | 1mo ago | |
| 50 simulated datasets T=2 | SUPER | Mean Regret0.0791 | 2 | 1mo ago |