Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

ARC Challenge AC ARC EASY AE Hellaswag HS Lambada Openai LO Lambada Standard LS PIQA PQ Winogrande WG

Benchmarks

Task NameDataset NameSOTA ResultTrend
Language Modeling and ReasoningARC-Challenge (AC), ARC-Easy (AE), HellaSwag (HS), LAMBADA-openai (LO), LAMBADA-standard (LS), PIQA (PQ), WinoGrande (WG) zero-shot
Accuracy (ARC-E)78.6
39
Showing 1 of 1 rows