| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Natural Language Understanding | Zero-shot Downstream Benchmarks (BoolQ, ARC-E, ARC-C, HellaSwag) | BoolQ Accuracy83.2 | 18 | |
| Natural Language Understanding | Downstream Benchmarks (HellaSwag, SIQA, PIQA, OBQA, WinoGrande, RACE) | HellaSwag42.96 | 10 | |
| General Language Understanding | Downstream Benchmarks (Winogrande, HellaSwag, ARC-E, ARC-C, MMLU) 0.3B-token distillation | Winogrande Accuracy82.6 | 8 | |
| Downstream Task Aggregation | 9 Downstream Benchmarks Average | Average Accuracy0.4563 | 6 | |
| Zero-shot Evaluation | Downstream Benchmarks Zero-shot (Hellaswag, ARC, PIQA, BoolQ, SciQ) | Hellaswag Accuracy (Zero-shot)29.23 | 4 |