Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reason scoring on human labels (held-out)
Loading...
59
wf1
SFT+GRPO
35.912
41.906
47.9
53.894
Jul 7, 2026
wf1
Change vs No-Think Baseline
Updated 18d ago
Evaluation Results
Method
Method
Links
wf1
Change vs No-Think Baseline
SFT+GRPO
Eval mode=think, n=254
2026.07
59
3.1
SFT
Eval mode=no-think, n=244
2026.07
57.7
-
SFT+GRPO
Eval mode=no-think, n=254
2026.07
55.9
-
Base
Eval mode=no-think, n=254
2026.07
52.9
-
Base
Eval mode=think, n=254
2026.07
44.9
8
Random baseline
Eval mode=–, n=259
2026.07
43.6
-
Kimi-K2.6
Eval mode=think, n=244
2026.07
38.4
-
Kimi-K2.6
Eval mode=no-think, n=250
2026.07
36.8
-
Feedback
Search any
task
Search any
task