Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-task Language Evaluation on Aggregate (All)
Loading...
41.2
Accuracy
Nexus
21.024
26.262
31.5
36.738
Apr 10, 2026
Accuracy
Loss
Updated 3mo ago
Evaluation Results
Method
Method
Links
Accuracy
Loss
Nexus
Model scale=3B
2026.04
41.2
1.786
Adam
Model scale=3B
2026.04
39
1.812
Nexus
Model scale=1B
2026.04
23.5
1.984
Adam
Model scale=1B
2026.04
21.8
2.011
Feedback
Search any
task
Search any
task