Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reward Model Learning on UFB
Loading...
72.5
Win Rate
URM
52.116
57.408
62.7
67.992
Jul 3, 2026
Win Rate
Updated 18d ago
Evaluation Results
Method
Method
Links
Win Rate
URM
Base Model=Llama-3.1-8B
2026.07
72.5
α-URM
Base Model=Llama-3.1-8B
2026.07
72.3
RM
Base Model=Llama-3.1-8B
2026.07
68.9
cRM
Base Model=Llama-3.1-8B
2026.07
66.5
α-URM
Base Model=Qwen-3-8B
2026.07
64.9
URM
Base Model=Qwen-3-8B
2026.07
64.6
rRM
Base Model=Qwen-3-8B
2026.07
63.9
rRM
Base Model=Llama-3.1-8B
2026.07
63.6
RM
Base Model=Qwen-3-8B
2026.07
54.3
cRM
Base Model=Qwen-3-8B
2026.07
52.9
Feedback
Search any
task
Search any
task