| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| τ-bench-retail | SkillMAS | Success Rate70.2 | 31 | 1mo ago | |
| ToolSandbox (test) | H-EPM | Avg Task Reward0.704 | 27 | 4mo ago | |
| τ2-BENCH (test) | H-EPM | Average Task Reward0.921 | 27 | 4mo ago | |
| τ-BENCH (test) | H-EPM | Average Task Reward0.791 | 27 | 4mo ago | |
| ClawGym-Bench | Product & Collaboration Score76 | 17 | 2mo ago | ||
| PinchBench | Pass@188.7 | 17 | 2mo ago | ||
| tau2-bench, SkillsBench, and ALFWorld Average | SkillsInjector | Average Pass Rate58.7 | 9 | 1mo ago | |
| SkillsBench | SkillsInjector | Pass Rate22.6 | 9 | 1mo ago | |
| tau2-bench telecom | SkillsInjector | Pass Rate67 | 9 | 1mo ago | |
| tau2-bench airline | SkillsInjector | Pass Rate60 | 9 | 1mo ago | |
| τ-bench airline | Success Rate19 | 8 | 1mo ago | ||
| AppWorld | PREPING | TGC Success Rate (N)83.7 | 7 | 2mo ago | |
| Agent calling-tree and platform skill-graph testbeds | MPNN world model | Success Rate @ 149.2 | 4 | 26d ago | |
| AppWorld (Resampled) | Metis | Accuracy (%)66.1 | 4 | 1mo ago | |
| AppWorld (Official) | Metis | Accuracy60.1 | 4 | 1mo ago | |
| ToolSandbox | GPT-5.1 with H-EPM | Average Task Reward0.67 | 2 | 4mo ago | |
| τ²-Bench | GPT-5.1 with H-EPM | Avg Task Reward92.1 | 2 | 4mo ago |