Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-task Language Evaluation on GSM8K, ARC-C, MedQA, BoolQ, and CoLA Average
Loading...
79.87
Average Accuracy
PROMPT CLASSIFICATION
65.102
68.936
72.77
76.604
Jun 30, 2026
Average Accuracy
Updated 25d ago
Evaluation Results
Method
Method
Links
Average Accuracy
PROMPT CLASSIFICATION
Composition Type=NONE,...
2026.06
79.87
HARD-ROUTED MOR-LORA
Composition Type=HARD...
2026.06
79.8
MOLE (α = 0.5)
Composition Type=SOFT...
2026.06
78.5
LORAMIXER TOPK=2 NORM.
Composition Type=NORMA...
2026.06
78.33
MOLE (α = 0.1)
Composition Type=SOFT...
2026.06
78.02
LORAMIXER TOPK=1
Composition Type=SOFT...
2026.06
77.74
LORAHUB
Composition Type=STATI...
2026.06
75.76
PROMPT CLASSIFICATION
Composition Type=NONE,...
2026.06
72.79
HARD-ROUTED MOR-LORA
Composition Type=HARD...
2026.06
72.07
LORAMIXER TOPK=2 NORM.
Composition Type=NORMA...
2026.06
70.81
MOLE (α = 0.1)
Composition Type=SOFT...
2026.06
68.66
MOLE (α = 0.5)
Composition Type=SOFT...
2026.06
68.5
LORAHUB
Composition Type=STATI...
2026.06
67.75
LORAMIXER TOPK=1
Composition Type=SOFT...
2026.06
65.67
Feedback
Search any
task
Search any
task