Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Code Generation on Hard Corpus 192 problems 4
Loading...
83.3
Correctness (pass@1)
AlgoSkill
51.372
59.661
67.95
76.239
Jun 29, 2026
Correctness (pass@1)
Updated 25d ago
Evaluation Results
Method
Method
Links
Correctness (pass@1)
AlgoSkill
Backbone=GPT-5.5
2026.06
83.3
Direct
Backbone=GPT-5.5
2026.06
81.8
CoT
Backbone=Sonnet-4-5
2026.06
77.1
AlgoSkill
Backbone=Sonnet-4-5
2026.06
77.1
CoT
Backbone=GPT-5.5
2026.06
76.6
Direct
Backbone=Sonnet-4-5
2026.06
75
AlgoSkill
Backbone=gpt-oss-120b
2026.06
75
AlgoSkill
Backbone=Haiku
2026.06
71.4
Direct
Backbone=Haiku
2026.06
70.3
CoT
Backbone=Haiku
2026.06
67.7
Direct
Backbone=gpt-oss-120b
2026.06
54.7
CoT
Backbone=gpt-oss-120b
2026.06
52.6
Feedback
Search any
task
Search any
task