| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| BBH | GHG-TDA | Accuracy95.4 | 770 | 26d ago | |
| ARC | Qwen-7B-Instruct | Accuracy94.5 | 269 | 1mo ago | |
| MMLU-Pro | Agent Q-Mix | Accuracy92.86 | 264 | 1mo ago | |
| ARC Easy | GPT-4 | Accuracy96.63 | 242 | 16d ago | |
| HellaSwag (HS) | HellaSwag Accuracy91.84 | 209 | 1mo ago | ||
| GPQA Diamond | Accuracy91.9 | 185 | 2mo ago | ||
| WinoGrande (WG) | InternLM2-20B | Accuracy85.2 | 172 | 1mo ago | |
| PIQA | LLaDA2.0-flash | Accuracy96.5 | 168 | 1mo ago | |
| ARC-c | Accuracy (ARC-c)96.3 | 113 | 23d ago | ||
| GSM8K | GPT-5.2 | Accuracy1 | 111 | 25d ago | |
| 7-benchmark commonsense and reading-comprehension suite (ARC-Easy, ARC-Challenge, HellaSwag, WinoGrande, PIQA, BoolQ, and OpenBookQA) LM Evaluation Harness default (test) | LATMiX-LU | Accuracy68.77 | 108 | 4mo ago | |
| ARC Challenge | Qwen3 | Accuracy97.2 | 100 | 2mo ago | |
| MATH 500 | Accuracy (%)100 | 94 | 2mo ago | ||
| BBH (test) | Agent-GWO | Accuracy73.9 | 94 | 2mo ago | |
| GPQA | GRPO | Accuracy71.43 | 92 | 1mo ago | |
| GPQA | Pass@190.1 | 92 | 1mo ago | ||
| OpenBookQA | BioBridge | Accuracy88.4 | 92 | 2mo ago | |
| ARC Challenge | Accuracy96.7 | 81 | 2mo ago | ||
| LiveBench Reasoning | DIP | Accuracy92 | 80 | 4mo ago | |
| GSM PRO | ZERO-SHOT | Accuracy100 | 72 | 3mo ago | |
| LiveCodeBench | pass@1 Accuracy55.45 | 71 | 1mo ago | ||
| Reasoning Benchmarks BBH, MMLU, ARC-C, ThmQA (test) | BBH64.66 | 66 | 1mo ago | ||
| MMLU-Pro | RAT | Average Score55 | 66 | 22d ago | |
| AIME 24 | Qwen3-Base SAT | Accuracy on AIME 2486.3 | 65 | 2mo ago | |
| HLE | Score64.7 | 65 | 18d ago |