Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multilingual Knowledge Evaluation on Global-MMLU High
Loading...
68.35
Accuracy
GRPO
34.082
42.9785
51.875
60.7715
Jun 4, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
GRPO
Backbone=Qwen-2.5-7B
2026.06
68.35
Baseline
Backbone=Qwen-2.5-7B
2026.06
68.15
CPT + GRPO
Backbone=Qwen-2.5-7B
2026.06
65.2
SFT
Backbone=Qwen-2.5-7B
2026.06
64.45
CPT + SFT
Backbone=Qwen-2.5-7B
2026.06
64.2
CPT
Backbone=Qwen-2.5-7B
2026.06
63.95
GRPO
Backbone=OLMo-2-1124-7B
2026.06
39.22
Baseline
Backbone=OLMo-2-1124-7B
2026.06
38.72
CPT
Backbone=OLMo-2-1124-7B
2026.06
37.41
CPT + GRPO
Backbone=OLMo-2-1124-7B
2026.06
36.34
CPT + SFT
Backbone=OLMo-2-1124-7B
2026.06
36.15
SFT
Backbone=OLMo-2-1124-7B
2026.06
35.4
Feedback
Search any
task
Search any
task