Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Planning on PlanBench-BW NL
Loading...
42.7
Accuracy (%)
Qwen3-Base SAT
29.18
32.69
36.2
39.71
Apr 17, 2026
Accuracy (%)
Updated 2mo ago
Evaluation Results
Method
Method
Links
Accuracy (%)
Qwen3-Base SAT
Size=3×4B
2026.04
42.7
OpenAI o3-mini (medium)
Size=/
2026.04
41.2
Qwen3 (thinking)
Size=32B
2026.04
40.3
Qwen3-A3B
Size=30B
2026.04
39.1
DeepSeek-R1 Distill Llama
Size=70B
2026.04
39.1
Qwen3-Base Debate + Judge
Size=3×8B
2026.04
39.1
Qwen3-Base Role-play
Size=3×8B
2026.04
38.7
Qwen3-Base Debate
Size=3×8B
2026.04
38.3
QwQ
Size=32B
2026.04
37.9
Llama 3.1-Base SAT
Size=3×8B
2026.04
37.1
GPT-4o-mini-2024-07-18
Size=/
2026.04
34.7
Qwen3-Base
Size=32B
2026.04
34.3
Qwen2.5-Base
Size=72B
2026.04
33.7
Qwen3-Base-DAPO
Size=8B
2026.04
33.5
Qwen3-Base-GRPO
Size=8B
2026.04
33.1
Qwen3-Base
Size=14B
2026.04
29.7
Feedback
Search any
task
Search any
task