| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Language Model Reasoning and Knowledge Evaluation | 10 LLM Benchmarks suite (AIME25, AIME26, CEval, GPQA-D, HLE, IMO-AB, MMLU, MMLU-Pro, MMLU-Rd, MultiCh) | AIME 25 Score70 | 20 | |
| General Language Understanding | LLM Benchmarks (ARC, HellaSwag, MMLU, TruthfulQA, Winogrande, GSM8K) | ARC Score55.55 | 9 | |
| Prompt Optimization | 42 LLM benchmarks Aggregate (overall) | Average Score67.14 | 5 |