Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multimodal Reasoning on MVerse
Loading...
76.9
Accuracy
Gemini-2.5-Pro
16.996
32.548
48.1
63.652
Jun 29, 2026
Accuracy
Updated 25d ago
Evaluation Results
Method
Method
Links
Accuracy
Gemini-2.5-Pro
Model Category=Closed-...
2026.06
76.9
GPT-5
Model Category=Closed-...
2026.06
66.7
Qwen3-VL-8B
Model Category=Open-so...
2026.06
62.1
TACO (Ours-7B)
Model Category=Code-to...
2026.06
57.2
PyVision-RL-7B
Model Category=Code-to...
2026.06
55.8
DeepEyes-v2-7B
Model Category=Code-to...
2026.06
52.7
CodeV-RL-7B
Model Category=Code-to...
2026.06
49.2
DeepEyes-7B
Model Category=Code-to...
2026.06
47.3
Pixel-Reasoner-7B
Model Category=Code-to...
2026.06
46.9
MathCoder-VL-8B
Model Category=Code-to...
2026.06
46.5
Mini-o3-7B
Model Category=Code-to...
2026.06
45.4
Qwen2.5-VL-32B
Model Category=Open-so...
2026.06
40
Thyme-7B
Model Category=Code-to...
2026.06
39.1
GPT-4o
Model Category=Closed-...
2026.06
35.3
Qwen2.5-VL-7B
Model Category=Open-so...
2026.06
35.2
InternVL3-8B
Model Category=Open-so...
2026.06
29.2
LLaVA-OneVision-7B
Model Category=Open-so...
2026.06
19.3
Feedback
Search any
task
Search any
task