Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

NLP Benchmark

Benchmarks

Task NameDataset NameSOTA ResultTrend
Model Merging7-task NLP benchmark
Avg Performance1.18
20
Natural Language InferenceNLP Benchmark (SNLI, MNLI, SICK, QNLI, RTE, SciTail) Llama-3-8B (val)
SNLI Accuracy97.56
12
Continual Learning8-domain NLP benchmark
Vanilla Forgetting11.8
5
Showing 3 of 3 rows