Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reasoning on Combined Reasoning Benchmarks
Loading...
59.29
Overall Accuracy
OpenSIR
34.7148
41.0949
47.475
53.8551
Nov 1, 2025
Nov 24, 2025
Dec 18, 2025
Jan 10, 2026
Feb 3, 2026
Feb 26, 2026
Mar 22, 2026
Overall Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Overall Accuracy
OpenSIR
Backbone=Qwen3-8B, Tra...
2025.11
59.29
GRPOmath
Backbone=Qwen3-8B, Tra...
2025.11
56.18
Base
Backbone=Qwen3-8B, Tra...
2025.11
55.89
GRPOgsm8k
Backbone=Qwen3-8B, Tra...
2025.11
55.15
Absolute Zero
Backbone=Qwen3-8B, Tra...
2025.11
54.53
R-Zero
Backbone=Qwen3-8B, Tra...
2025.11
53.96
WIST
Backbone=Qwen3-14B-Base
2026.03
49.4
SPICE
Backbone=Qwen3-14B-Base
2026.03
48.6
R-Zero
Backbone=Qwen3-14B-Base
2026.03
47.5
Base Model
Backbone=Qwen3-14B-Base
2026.03
46.2
OpenSIR
Backbone=DeepSeek-R1-D...
2025.11
40.56
GRPOmath
Backbone=DeepSeek-R1-D...
2025.11
37.27
GRPOgsm8k
Backbone=DeepSeek-R1-D...
2025.11
36.97
Base
Backbone=DeepSeek-R1-D...
2025.11
36.31
R-Zero
Backbone=DeepSeek-R1-D...
2025.11
36.25
Absolute Zero
Backbone=DeepSeek-R1-D...
2025.11
35.66
Feedback
Search any
task
Search any
task