Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
General LLM quality assessment on Quality benchmark 20 tasks (test)
Loading...
100
Code Generation Accuracy
Remote Speculate
16.8
38.4
60
81.6
Jun 22, 2026
Code Generation Accuracy
Math Reasoning Accuracy
Instruction Following Accuracy
Overall Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Code Generation Accuracy
Math Reasoning Accuracy
Instruction Following Accuracy
Overall Accuracy
Remote Speculate
Inference Strategy=Spe...
2026.06
100
100
100
100
Remote Native Opus
Inference Strategy=Nat...
2026.06
100
100
80
95
Local vLLM
Quantization=4-bit, Mo...
2026.06
20
0
0
10
Feedback
Search any
task
Search any
task