Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Code Generation on HumanEval (P@1, P@32, #Tok)
Loading...
63.62
Pass@1
TARPO
58.0976
59.5313
60.965
62.3987
Jun 4, 2026
Pass@1
Pass@32
Avg Tokens
Updated 1mo ago
Evaluation Results
Method
Method
Links
Pass@1
Pass@32
Avg Tokens
TARPO
Backbone=Qwen2.5-3B-In...
2026.06
63.62
88.41
256.1
Pure Latent
Backbone=Qwen2.5-3B-In...
2026.06
60.19
82.32
261.4
CoT
Backbone=Qwen2.5-3B-In...
2026.06
59.68
90.24
271.4
HRPO
Backbone=Qwen2.5-3B-In...
2026.06
59.51
90.85
340.5
GRPO
Backbone=Qwen2.5-3B-In...
2026.06
58.86
92.07
355.6
Entropy-Routed
Backbone=Qwen2.5-3B-In...
2026.06
58.31
90.24
260.5
Feedback
Search any
task
Search any
task