Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Tülu

Benchmarks

Task NameDataset NameSOTA ResultTrend
Multi-task Language Model EvaluationTÜLU Evaluation Suite (MMLU, TQA, PopQA, BBH, DROP, CHE, CHE+, GSM8K, MATH, IFEval) 2/3
MMLU Accuracy62.1
24
Membership Inference AttackTÜLU
N-Gram Coverage (Cov.)85
7
General Capability EvaluationTülu General Benchmarks 3
MMLU45
6
Safety EvaluationTülu Safety Benchmarks 3
DAN Score89
6
Showing 4 of 4 rows