Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multimodal long-horizon complex reasoning on BrowseComp-VL
Loading...
55.6
Score
Claude-4.6-Sonnet-Thinking
25.648
33.424
41.2
48.976
Jun 13, 2026
Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
Score
Claude-4.6-Sonnet-Thinking
Size=-, Train=-
2026.06
55.6
REDSearcher-MM-SFT
Size=30B, Train=Mid/SFT
2026.06
55.3
Vision-DeepResearch
Size=30B, Train=SFT/RL
2026.06
53.7
Doubao-2.0-Pro
Size=-, Train=-
2026.06
48.4
GPT-5.2
Size=-, Train=-
2026.06
45.6
Qwen3.5-397B
Size=397B, Train=-
2026.06
45.4
MM-DeepResearch
Size=32B, Train=SFT/RL
2026.06
43
Gemini-3.1-Pro-Preview
Size=-, Train=-
2026.06
41.1
MiniMax-M2.7
Size=230B, Train=-
2026.06
40.1
S1-DeepResearch
Size=32B, Train=SFT
2026.06
39.1
Skywork-R1V4-30B
Size=30B, Train=SFT
2026.06
38.4
Kimi-K2.5
Size=1T, Train=-
2026.06
37.1
GLM-5
Size=744B, Train=-
2026.06
34.6
Qwen3-235B
Size=235B, Train=-
2026.06
32.8
DeepSeek-V3.2
Size=671B, Train=-
2026.06
30.3
Qwen3-32B
Size=32B, Train=-
2026.06
26.8
Feedback
Search any
task
Search any
task