| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Zero-shot Commonsense Reasoning | ARC-Easy, ARC-Challenge, HellaSwag, PIQA, WinoGrande lm-evaluation-harness (test) | ARC-e Accuracy82.87 | 43 | |
| Zero-shot Downstream Tasks | ARC-C, ARC-E, HellaSwag, PIQA, and WinoGrande | Downstream Average74.35 | 10 |