Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Compositional Reasoning on MAT-PREF (IID)
Loading...
65.2
Logical Question Accuracy
Qwen3-8B + SFT + GRPO
20.168
31.859
43.55
55.241
Jun 20, 2026
Logical Question Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Logical Question Accuracy
Qwen3-8B + SFT + GRPO
training_stage=SFT + GRPO
2026.06
65.2
Qwen3-8B + SFT (SC@8)
training_stage=SFT, ev...
2026.06
50.6
Qwen3-8B + SFT
training_stage=SFT
2026.06
44.9
Qwen3-235B-Instruct
mode=zero-shot
2026.06
43.8
Qwen2.5-72B
mode=zero-shot
2026.06
37.1
DeepSeek-V3
mode=zero-shot
2026.06
36
Llama 3.3-70B
mode=zero-shot
2026.06
33.7
Random baseline
evaluation_protocol=ma...
2026.06
21.9
Feedback
Search any
task
Search any
task