Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Massive Multitask Language Understanding on MMLU (Pass@1)
Loading...
87.68
Pass@1 Score
Qwen 3.5
78.6008
80.9579
83.315
85.6721
May 11, 2026
Pass@1 Score
Updated 2mo ago
Evaluation Results
Method
Method
Links
Pass@1 Score
Qwen 3.5
Zero-shot=true, Parame...
2026.05
87.68
Nemotron 3 Super
Zero-shot=true, Parame...
2026.05
85.47
Phoenix-VL 1.5 Medium
Zero-shot=true, Parame...
2026.05
83.48
Llama 4 Maverick
Zero-shot=true, Parame...
2026.05
78.98
GLM-4.5V
Zero-shot=true, Parame...
2026.05
78.95
Feedback
Search any
task
Search any
task