| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| 16-task evaluation suite 1B/25B checkpoints (test) | HERMES + L12 quality top-30% | Average Score42.22 | 20 | 23d ago | |
| GSM8K, ARC-C, MedQA, BoolQ, and CoLA Evaluation Average | PROMPT CLASSIFICATION | Average Accuracy79.87 | 14 | 25d ago | |
| FineTasks average across languages | MLP MKC+ | Average Rank4.35 | 7 | 5mo ago | |
| Spanish Language Evaluation Suite | Qwen2.5 | ARC-C (es)37.78 | 6 | 3mo ago | |
| Aggregate (All) | Nexus | Accuracy41.2 | 4 | 3mo ago | |
| SEA-HELM | SiamGPT-32B | Instruction Following (SEA-IFEval)83 | 3 | 5mo ago |