Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Compositional Reasoning on MAT-PREF (OOD-host)
Loading...
71.6
Logical Question Accuracy
Qwen3-8B + SFT + GRPO
23.136
35.718
48.3
60.882
Jun 20, 2026
Logical Question Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Logical Question Accuracy
Qwen3-8B + SFT + GRPO
training_stage=SFT + GRPO
2026.06
71.6
Qwen3-8B + SFT (SC@8)
training_stage=SFT, ev...
2026.06
50.4
Qwen3-8B + SFT
training_stage=SFT
2026.06
47.9
Qwen3-235B-Instruct
mode=zero-shot
2026.06
45.4
DeepSeek-V3
mode=zero-shot
2026.06
36.5
Llama 3.3-70B
mode=zero-shot
2026.06
35.1
Qwen2.5-72B
mode=zero-shot
2026.06
33.3
Random baseline
evaluation_protocol=ma...
2026.06
25
Feedback
Search any
task
Search any
task