Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Downstream Benchmarks

Benchmarks

Task NameDataset NameSOTA ResultTrend
Natural Language UnderstandingZero-shot Downstream Benchmarks (BoolQ, ARC-E, ARC-C, HellaSwag)
BoolQ Accuracy83.2
18
Natural Language UnderstandingDownstream Benchmarks (HellaSwag, SIQA, PIQA, OBQA, WinoGrande, RACE)
HellaSwag42.96
10
General Language UnderstandingDownstream Benchmarks (Winogrande, HellaSwag, ARC-E, ARC-C, MMLU) 0.3B-token distillation
Winogrande Accuracy82.6
8
Downstream Task Aggregation9 Downstream Benchmarks Average
Average Accuracy0.4563
6
Zero-shot EvaluationDownstream Benchmarks Zero-shot (Hellaswag, ARC, PIQA, BoolQ, SciQ)
Hellaswag Accuracy (Zero-shot)29.23
4
Showing 5 of 5 rows