Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Code Generation Pass@1 on HumanEval+
Loading...
94.5
Pass@1
Gemini-3-Pro
58.412
67.781
77.15
86.519
Jun 16, 2026
Pass@1
Updated 1mo ago
Evaluation Results
Method
Method
Links
Pass@1
Gemini-3-Pro
2026.06
94.5
Claude-Opus-4.5
2026.06
93.3
Qwen3-Coder-480B-A35B-Instruct
2026.06
92.7
Qwen3-235B-A22B-Instruct-2507
2026.06
91.5
GPT-5.1
2026.06
90
Kimi-K2-Instruct-0905
2026.06
89.6
DeepSeek-V3.2
2026.06
88.4
Qwen2.5-Coder-32B-Instruct
2026.06
86.6
Kimi-Dev-72B
2026.06
86
LoopCoder-v2
R (number of refinemen...
2026.06
84.1
Qwen2.5-Coder-7B-Instruct
2026.06
81.7
LoopCoder-v2
R (number of refinemen...
2026.06
81.1
GLM-4.7
2026.06
79.9
LoopCoder-v2
R (number of refinemen...
2026.06
76.8
DeepSeek-Coder-V2-Lite-Instruct
2026.06
75.6
Seed-Coder-8B-Instruct
2026.06
75.6
LoopCoder-v2
R (number of refinemen...
2026.06
75
Qwen2.5-Coder-14B-Instruct
2026.06
59.8
Feedback
Search any
task
Search any
task