Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-domain Language Model Evaluation on Knowledge, Math, Code, Reasoning, and Biomedical Domains
Loading...
69.2
Average Accuracy
CODA
54.848
58.574
62.3
66.026
Jul 3, 2026
Average Accuracy
Updated 18d ago
Evaluation Results
Method
Method
Links
Average Accuracy
CODA
Backbone=Gemma-2-9B, C...
2026.07
69.2
GradNorm
Backbone=Gemma-2-9B, C...
2026.07
68.3
CODA
Backbone=Qwen-2.5-7B,...
2026.07
68
Full data
Backbone=Gemma-2-9B
2026.07
67.2
GradNorm
Backbone=Qwen-2.5-7B,...
2026.07
66.8
Full data
Backbone=Qwen-2.5-7B
2026.07
66.2
CODA
Backbone=Qwen-2.5-3B,...
2026.07
63.6
GradNorm
Backbone=Qwen-2.5-3B,...
2026.07
62.8
Full data
Backbone=Qwen-2.5-3B
2026.07
61.5
CODA
Backbone=Mistral-7B, C...
2026.07
60.3
GradNorm
Backbone=Mistral-7B, C...
2026.07
59.4
Full data
Backbone=Mistral-7B
2026.07
58.2
CODA
Backbone=LLaMA-3.1-8B,...
2026.07
57.2
GradNorm
Backbone=LLaMA-3.1-8B,...
2026.07
56
Full data
Backbone=LLaMA-3.1-8B
2026.07
55.4
Feedback
Search any
task
Search any
task