Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Complex Reasoning on LLaVA-Bench Wilder
Loading...
74.3
Score
Qwen3-VL-4B (Base)
51.42
57.36
63.3
69.24
Jun 2, 2026
Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
Score
Qwen3-VL-4B (Base)
Base Model=Qwen3-VL-4B...
2026.06
74.3
COPSD (Standard)
Base Model=Qwen3-VL-4B...
2026.06
74.1
COPSD (Hybrid)
Base Model=Qwen3-VL-4B...
2026.06
73.4
OPD
Base Model=Qwen3-VL-4B...
2026.06
70.5
SFT
Base Model=Qwen3-VL-4B...
2026.06
70.4
Qwen2.5-VL-7B (Base)
Base Model=Qwen2.5-VL-...
2026.06
69.9
COPSD (Standard)
Base Model=Qwen2.5-VL-...
2026.06
69.4
COPSD (Hybrid)
Base Model=Qwen2.5-VL-...
2026.06
68.5
GRPO
Base Model=Qwen3-VL-4B...
2026.06
68.2
OPD
Base Model=Qwen2.5-VL-...
2026.06
67.2
GRPO
Base Model=Qwen2.5-VL-...
2026.06
67
SFT
Base Model=Qwen2.5-VL-...
2026.06
66.7
Safe-RLHF-V
Base Model=Qwen3-VL-4B...
2026.06
56.8
Safe-RLHF-V
Base Model=Qwen2.5-VL-...
2026.06
52.3
Feedback
Search any
task
Search any
task