| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Zero-shot Evaluation | Arc-Challenge, Arc-Easy, HellaSwag, LAMBADA-openai, LAMBADA-standard, PIQA, and WinoGrande Zero-Shot | Accuracy (0-shot)76.71 | 123 | |
| Language Understanding and Reasoning | ARC-C, ARC-E, HellaSwag, LAMBADA, PIQA, WinoGrande (test) | Mean Score56.81 | 5 |