| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Model Merging | 7-task NLP benchmark | Avg Performance1.18 | 20 | |
| Natural Language Inference | NLP Benchmark (SNLI, MNLI, SICK, QNLI, RTE, SciTail) Llama-3-8B (val) | SNLI Accuracy97.56 | 12 | |
| Continual Learning | 8-domain NLP benchmark | Vanilla Forgetting11.8 | 5 |