Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Response Quality Evaluation on AlpacaEval ELOM gpt4 (test)
Loading...
1,629
ELOM
(ai, ai+1)
1,341.96
1,416.48
1,491
1,565.52
Dec 29, 2025
ELOM
Updated 5mo ago
Evaluation Results
Method
Method
Links
ELOM
(ai, ai+1)
training_pairs=1303, s...
2025.12
1,629
(a0, a*)
training_pairs=277, st...
2025.12
1,617
(ai, ai+1)ds
training_pairs=277, st...
2025.12
1,602
(a0, a1)
training_pairs=277, st...
2025.12
1,435
(a, b)
training_pairs=277, st...
2025.12
1,376
base
training_pairs=0
2025.12
1,355
a* SFT
training_pairs=277, st...
2025.12
1,353
Feedback
Search any
task
Search any
task