Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Instruction Following on AlpacaEval (805 prompts)
Loading...
7.22
OLMo-2 Reward Score
AAD
1.2816
2.8233
4.365
5.9067
Sep 30, 2025
OLMo-2 Reward Score
Win Rate vs SFT Baseline
AlpacaEval Win Rate
Updated 1mo ago
Evaluation Results
Method
Method
Links
OLMo-2 Reward Score
Win Rate vs SFT Baseline
AlpacaEval Win Rate
AAD
Backbone=OLMo-2-13B
2025.09
7.22
98
-
EFT
Backbone=OLMo-2-13B
2025.09
6.97
96
55.8
Bo2
Backbone=OLMo-2-13B
2025.09
6.94
96
65.2
Greedy DPO
Backbone=OLMo-2-13B
2025.09
6.87
95
75.2
Greedy SFT
Backbone=OLMo-2-13B
2025.09
5.02
-
93.9
AAD
Backbone=OLMo-2-7B
2025.09
3.84
98
-
EFT
Backbone=OLMo-2-7B
2025.09
3.5
96
58.1
Bo2
Backbone=OLMo-2-7B
2025.09
3.44
97
64.6
Greedy DPO
Backbone=OLMo-2-7B
2025.09
3.27
94
71.5
Greedy SFT
Backbone=OLMo-2-7B
2025.09
1.51
-
91.6
Feedback
Search any
task
Search any
task