Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Visual Mathematical Reasoning on DynaMath (Worst-case Accuracy)
Loading...
35.73
Worst-case Accuracy
RL-Evol + Verifier (full VeriEvol)
15.7308
20.9229
26.115
31.3071
Jun 22, 2026
Worst-case Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Worst-case Accuracy
RL-Evol + Verifier (full VeriEvol)
Training Stage=RL, Mod...
2026.06
35.73
OpenMMReasoner-7B
Training Stage=Baselin...
2026.06
34.9
OVR-7B
Training Stage=Baselin...
2026.06
33.5
RL-Evol
Training Stage=RL, Mod...
2026.06
32.14
VeriEvol-SFT (VeriEvol-SFT-Init)
Training Stage=SFT, Mo...
2026.06
30.94
RL-Origin
Training Stage=RL, Mod...
2026.06
30.54
MMR1-Math-v0
Training Stage=Baselin...
2026.06
27.9
ReVisual-R1-7B
Training Stage=Baselin...
2026.06
27.5
Seed-only SFT
Training Stage=SFT, Mo...
2026.06
26.96
WeThink-7B
Training Stage=Baselin...
2026.06
24.4
MM-Eureka-Qwen-7B
Training Stage=Baselin...
2026.06
23
InternVL3-8B
Training Stage=Baselin...
2026.06
23
VLAA-Thinker-7B
Training Stage=Baselin...
2026.06
22.4
Qwen2.5-VL-7B-Instruct
Training Stage=Baselin...
2026.06
18
VL-Rethinker-7B
Training Stage=Baselin...
2026.06
17.8
OpenVLThinker-7B
Training Stage=Baselin...
2026.06
16.8
ThinkLite-VL-7B
Training Stage=Baselin...
2026.06
16.5
Feedback
Search any
task
Search any
task