| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| HumanEval | HumanEval Accuracy96.34 | 118 | 1mo ago | ||
| MBPP | FLARE-9B | Pass@191.05 | 73 | 1mo ago | |
| HumanEval+ | SUN | Accuracy79.9 | 43 | 2mo ago | |
| LiveCodeBench V5-6 | Reasoning Memory | Accuracy50.8 | 33 | 3mo ago | |
| LiveCodeBench V1-4 | Reasoning Memory | Accuracy47.1 | 33 | 3mo ago | |
| LiveCode | Lowest Centroid | Accuracy83.6 | 30 | 2mo ago | |
| CRUX | CoReward | Accuracy @555.08 | 27 | 2mo ago | |
| LiC Code | DeepSeek-R1 | Concat Score97.1 | 21 | 3mo ago | |
| LCB v6 | Score87.7 | 20 | 1mo ago | ||
| HumanEval (test) | LightMoE | HumanEval Success Rate58.1 | 17 | 2mo ago | |
| LCB | DARE + TIES | AVG@864.3 | 16 | 18d ago | |
| MBPP | AIPO | Average Performance67.19 | 16 | 1mo ago | |
| LiveCodeBench v6 | Score90.7 | 14 | 23d ago | ||
| LCB | BASTION | Speedup8.37 | 12 | 1mo ago | |
| MBPP | BASTION | Speedup7.68 | 12 | 1mo ago | |
| LiveCodeBench v5 | Qwen3-14B + NGM | Score29.94 | 10 | 2mo ago | |
| MBPP 1,000-example (test) | Qwen3-VL-2B-Instruct | Perplexity9.0212 | 10 | 4mo ago | |
| LiveCodeBench v6 | Pass@167.3 | 9 | 1mo ago | ||
| MBPP | Score93.77 | 9 | 1mo ago | ||
| CRUX-I | DSR | Score39.75 | 9 | 2mo ago | |
| LiveCodeBench | DSR | Score13.88 | 9 | 2mo ago | |
| BigCodeBench | Cosine-decay | Score40 | 9 | 2mo ago | |
| HumanEval pass@1 | Pass@167.07 | 9 | 4mo ago | ||
| HumanEval | PromptCOS | True WS Score1 | 8 | 2mo ago | |
| MBPP Sanitized | Nemotron-3-Ultra 550B-A55B-Base | pass@185.97 | 8 | 1mo ago |