Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Code Generation on HumanEval+ (Score)
Loading...
34.76
Score
ARES-RL
17.0176
21.6238
26.23
30.8362
May 22, 2026
May 29, 2026
Jun 5, 2026
Jun 12, 2026
Jun 19, 2026
Jun 26, 2026
Jul 3, 2026
Score
Updated 19d ago
Evaluation Results
Method
Method
Links
Score
ARES-RL
Backbone=Qwen3-32B
2026.05
34.76
Webscale
Backbone=Qwen3-32B
2026.05
33.54
NaturalReasoning
Backbone=Qwen3-32B
2026.05
32.93
CPT
Backbone=Qwen3-32B
2026.05
32.32
ARES-SFT
Backbone=Qwen3-32B
2026.05
31.1
Olmo3 Base
Tuning Protocol=Freezi...
2026.07
20.1
LMK token tuning
Tuning Protocol=Freezi...
2026.07
19.5
Olmo3 512swa
Tuning Protocol=Full p...
2026.07
19.5
HiLS-Attn HoPE-Q-Cal
Tuning Protocol=Full p...
2026.07
18.9
HiLS-Attn RoPE-Q-Cal
Tuning Protocol=Full p...
2026.07
18.9
HiLS-Attn NoPE-Q-Cal
Tuning Protocol=Full p...
2026.07
17.7
Feedback
Search any
task
Search any
task