Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reward Modeling on RewardBench External Evaluation
Loading...
93.3
Chat Score
Nominal PL
86.02
87.91
89.8
91.69
Jul 2, 2026
Chat Score
Chat Hard Score
Safety Score
Reasoning Score
RewardBench Average Score
Updated 22d ago
Evaluation Results
Method
Method
Links
Chat Score
Chat Hard Score
Safety Score
Reasoning Score
RewardBench Average Score
Nominal PL
Model=Qwen3-8B, K=4, T...
2026.07
93.3
45
56.9
52.9
62
Robust PL (ρ = 0.05)
Model=Qwen3-8B, K=4, T...
2026.07
93
43
58.2
53.6
61.96
Nominal BT
Model=Qwen3-8B, K=4, T...
2026.07
90.5
46.5
55.3
51.5
60.9
Nominal BT
Model=Qwen3-0.6B, K=4,...
2026.07
89.1
41
45.7
68.6
61.1
Robust PL (ρ = 0.05)
Model=Qwen3-0.6B, K=4,...
2026.07
88.3
42.5
47
72.7
62.6
Nominal PL
Model=Qwen3-0.6B, K=4,...
2026.07
86.3
40.6
46.2
71.5
61.2
Feedback
Search any
task
Search any
task