Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Code Generation on HumanEval+ (Pass@1 accuracy)
Loading...
88.9
Pass@1 Accuracy
Thinking onRL
78.084
80.892
83.7
86.508
Jun 29, 2026
Pass@1 Accuracy
Updated 26d ago
Evaluation Results
Method
Method
Links
Pass@1 Accuracy
Thinking onRL
Model Size=Qwen3-32B,...
2026.06
88.9
Thinking onRL
Model Size=Qwen3-8B, C...
2026.06
87.8
NeuReasoner
Model Size=Qwen3-32B,...
2026.06
87.6
Thinking off
Model Size=Qwen3-32B,...
2026.06
80.3
NeuReasoner
Model Size=Qwen3-8B, C...
2026.06
79.7
Thinking off
Model Size=Qwen3-8B, C...
2026.06
78.5
Feedback
Search any
task
Search any
task