| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| MMMLU (test) | MSD (Off-Policy) | Accuracy66.88 | 52 | 2mo ago | |
| M-MMLU (test) | COMPASS | Overall Accuracy59.6 | 38 | 3mo ago | |
| MMMLU | CLCall76.1 | 30 | 4mo ago | ||
| MMLU-ProX | Super | Accuracy79.5 | 28 | 18d ago | |
| MMLU-ProX (test) | COMPASS | Accuracy43.6 | 24 | 3mo ago | |
| MMMLU (Massive Multilingual Language Understanding) | Qwen-3-30B-A3B | Accuracy79.5 | 21 | 4mo ago | |
| MMMLU | Task Arithmetic | Accuracy (Korean)60.5 | 20 | 18d ago | |
| Qwen Multi-task Evaluation Suite 2.5 (test) | TriMix (PPL) | MC Score59.5 | 18 | 3mo ago | |
| French (HellaSwag, ARC-Challenge, XNLI, and MMLU) translated (test) | GenKnowSub | HellaSwag Accuracy57.83 | 8 | 4mo ago | |
| German (HellaSwag, ARC-Challenge, XNLI, and MMLU) translated (test) | Phi-3 | HellaSwag52.48 | 8 | 4mo ago | |
| Portuguese | Qwen2.5 | Average Performance64.6 | 6 | 4mo ago | |
| French | Qwen2.5 | Average Performance55.5 | 6 | 4mo ago | |
| Spanish | Gamayun | Average Performance55.7 | 6 | 4mo ago | |
| German | Qwen2.5 | Average Performance55.7 | 6 | 4mo ago | |
| Bulgarian | Gamayun | Average Performance48.4 | 6 | 4mo ago | |
| Arabic | Gamayun | Average Performance0.572 | 6 | 4mo ago | |
| Russian | Gamayun | Arc-ru34.9 | 6 | 4mo ago | |
| Chinese | Qwen2.5 | Average Performance68.7 | 5 | 4mo ago | |
| Thai | Qwen2.5 | Avg Performance54.5 | 5 | 4mo ago | |
| Multilingual Understanding | Qwen2-72B | Accuracy80.7 | 5 | 4mo ago | |
| MMLU ProX-Lite | Accuracy (en)78.2 | 3 | 3mo ago | ||
| INCLUDE 5-shot | ERNIE 5.0-Base | Accuracy77.81 | 3 | 4mo ago | |
| MMMLU 5-shot | ERNIE 5.0-Base | Accuracy78.94 | 3 | 4mo ago | |
| MMMLU | Llama-Instruct | Normalized Log Accuracy (MMMLU)78.3 | 2 | 4mo ago | |
| GlobalMMLU, MMMLU, MMLU-ProX-Lite, BELEBELE | - | - | 0 | 2mo ago |