Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multilingual Code Generation on HumanEval-X Python
Loading...
100
Quality
Okshot
97.296
97.998
98.7
99.402
Jun 25, 2026
Quality
Cost ($)
Error Rate Reduction (%)
Updated 29d ago
Evaluation Results
Method
Method
Links
Quality
Cost ($)
Error Rate Reduction (%)
Okshot
k-shot=10
2026.06
100
0.29
100
Okshot
k=1
2026.06
99.6
0.029
83.7
SOTA LLM
2026.06
97.4
0.003
-
SOTA LLM
2026.06
97.4
0.003
-
Feedback
Search any
task
Search any
task