Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Manipulation on Real World OOD
Loading...
80
Success Rate
GPT-5-Thinking
4.08
23.79
43.5
63.21
Sep 27, 2025
Success Rate
Average Success Rate
Updated 1mo ago
Evaluation Results
Method
Method
Links
Success Rate
Average Success Rate
GPT-5-Thinking
Access level (Closed-s...
2025.09
80
59
GPT-5-Thinking-Tool
Access level (Closed-s...
2025.09
80
77
Uni-Plan
Model scale (Parameter...
2025.09
63
70
VLP
Access level (Closed-s...
2025.09
43
56
Qwen2.5-VL-32B-Ins-CoT
Access level (Closed-s...
2025.09
33
44
BAGEL-VLM-CoT (baseline, 7B)
Access level (Closed-s...
2025.09
26
41
Qwen2.5-VL-7B-Ins-CoT
Access level (Closed-s...
2025.09
22
26
Qwen2.5-VL-32B-Ins
Access level (Closed-s...
2025.09
18
25
GPT-5
Access level (Closed-s...
2025.09
10
12
BAGEL-VLM (baseline, 7B)
Access level (Closed-s...
2025.09
9
21
Qwen2.5-VL-7B-Ins
Access level (Closed-s...
2025.09
7
14
Feedback
Search any
task
Search any
task