Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-objective alignment on Helpful Assistant (test)
Loading...
0.76
Helpfulness Score
RLHF-r1
-0.8728
-0.4489
-0.025
0.3989
May 16, 2025
Helpfulness Score
Humour Score
Harmlessness Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
Helpfulness Score
Humour Score
Harmlessness Score
RLHF-r1
Targeted Reward=r1
2025.05
0.76
-0.42
-0.23
MOPO-Lag
Variation=Lagrangian
2025.05
0.39
0.22
0.17
PARM
2025.05
0.31
0.17
0.23
MOPO-LB
Variation=LB
2025.05
0.3
0.19
0.18
RiC
2025.05
0.25
0.15
0.11
DPO on DJ
Dataset=DJ
2025.05
0.18
0.09
0.11
MODPO
2025.05
0.04
-0.09
0.08
RLHF-r3
Targeted Reward=r3
2025.05
-0.79
-0.92
0.42
RLHF-r2
Targeted Reward=r2
2025.05
-0.81
0.53
-0.4
Feedback
Search any
task
Search any
task