Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Comprehensive Reasoning on Aggregate Benchmarks
Loading...
66.9
Average Accuracy
Qwen2.5-VL-7B + DUPL
51.924
55.812
59.7
63.588
Oct 1, 2025
Average Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average Accuracy
Qwen2.5-VL-7B + DUPL
Base Model=Qwen2.5-VL-...
2025.10
66.9
Qwen2.5-VL-7B + NoisyRollout
Base Model=Qwen2.5-VL-...
2025.10
65.4
PAPO-7B
Base Model=PAPO-7B
2025.10
65.2
Qwen2.5-VL-7B + GRPO
Base Model=Qwen2.5-VL-...
2025.10
63.9
VLAA-Thinker-7B
Base Model=VLAA-Thinke...
2025.10
63.6
MM-Eureka-Qwen-7B
Base Model=MM-Eureka-Q...
2025.10
63.5
OpenVLThinker-7B
Base Model=OpenVLThink...
2025.10
61.9
Qwen2.5-VL-3B + DUPL
Base Model=Qwen2.5-VL-...
2025.10
61.2
Qwen2.5-VL-7B
Base Model=Qwen2.5-VL-7B
2025.10
61.1
R1-Onevision-7B
Base Model=R1-Onevisio...
2025.10
60.5
Qwen2.5-VL-3B + NoisyRollout
Base Model=Qwen2.5-VL-...
2025.10
59.6
Qwen2.5-VL-3B + GRPO
Base Model=Qwen2.5-VL-...
2025.10
58.4
Qwen2.5-VL-3B
Base Model=Qwen2.5-VL-3B
2025.10
52.5
Feedback
Search any
task
Search any
task