Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Coding

Benchmarks

Task NameDataset NameSOTA ResultTrend
GenerationCoding domain
Average Wall-Clock Time (s)4.14
40
Code GenerationCoding
Pass@156.1
40
Code GenerationCoding Eval+ LiveCode (test)
Eval+ Score87.2
32
Response correctness and completeness evaluationCoding
F1 Score85
32
Pairwise Comparison Accuracy RefinementCoding
Original Accuracy63.92
30
CodingCoding Real-data 20% verified
Original Accuracy63.92
30
Multi-Agent System PerformanceCoding
TS Score65
16
CodingCoding (val)
Pass@16100
16
ReasoningCoding
Normalized Score102.1
9
Prompt Injection DetectionCoding Direct Prompt Injection
FPR0
7
LLM-as-a-judge EvaluationCoding Qwen (n=8884)
Adjusted Accuracy77.74
5
LLM-as-a-judge EvaluationCoding GPT-5.4
Adjusted Accuracy67.2
5
Code GenerationCoding Gender (test)
Cor (%)40
5
Code GenerationCoding Race (test)
Correctness Rate57
5
CodingCoding Grouped General-Purpose Metrics
Coding Accuracy83.72
3
Prompt Ambiguity LocalizationCoding Synthetic (held-out evaluation set)
AUROC0.922
3
Agentic CodingCoding unseen tasks (test)
Pass@129.2
3
Agent task performanceCoding 20-task (held-out)
G Score81.2
2
CodingCoding Hard
Baseline Score36.67
1
CodingCoding Medium
Baseline Score31.96
1
CodingCoding Easy
Baseline51.14
1
Showing 21 of 21 rows