| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| Agent Evaluation Dataset (20 agents x 2 requirement types) | Time (min)0.68 | 10 | 2mo ago | ||
| Auto-ClawEval Mini (104 environments) | Safety Score94.2 | 8 | 3mo ago | ||
| Auto-ClawEval | Safety93.3 | 8 | 3mo ago | ||
| FutureX May W2, 56 events | Rank5 | 6 | 1mo ago | ||
| OpenThoughts TBLite | Kimi-K2.5 | Accuracy72.1 | 5 | 1mo ago | |
| VSM full (evaluation) | Average Rating85.96 | 4 | 3mo ago | ||
| GAIA-127 | Kimi-K2.5 | Accuracy58.3 | 3 | 1mo ago | |
| Terminal-Bench 2.0 | Kimi-K2.5 | Accuracy40.1 | 3 | 1mo ago | |
| FutureX 48 events May W1 | FutureGPTv1 | Rank1 | 3 | 1mo ago | |
| FutureX Apr. W4 48 events | MiroFlow | Rank1 | 3 | 1mo ago | |
| FutureX 56 events Apr. W3 | Rank2 | 3 | 1mo ago | ||
| BFCL Parity | GLM-5 | Accuracy86.2 | 2 | 1mo ago |