| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| PRISM (test) | EXACT | Accuracy66.62 | 51 | 4mo ago | |
| Arena-Expert-5K, HelpSteer3, HH-RLHF, and UltraFeedback (held-out) | PREMISE (+ pref repair) | Accuracy70.5 | 42 | 1mo ago | |
| JudgeBench | MRRG | Positional Consistent Accuracy74.8 | 30 | 22d ago | |
| RewardBench | Accuracy92.2 | 25 | 1mo ago | ||
| PPE Preference (test) | Skywork-Reward-V2-Llama-3.1-8B-40M | Preference Score79.8 | 24 | 4mo ago | |
| MMRB2 out-of-domain | AutoRubric-T2I (on PickScore) | EvalMuse Score70.7 | 22 | 2mo ago | |
| MovieLens 10k | Accuracy (Q=0.25)61 | 20 | 1mo ago | ||
| PickScore (test) | DRM | Accuracy73.4 | 19 | 2mo ago | |
| HPD v3 (test) | HPSv3 - 7B | Accuracy76.9 | 14 | 2mo ago | |
| VLRM-Bench | PRISM | Preference Prediction Score (k=99)80.25 | 12 | 1mo ago | |
| VideoGen-RewardBench | PRISM | Score @ Threshold 9976.81 | 12 | 1mo ago | |
| Sushi Preference Category B | Accuracy (0.25 Quantile)67 | 10 | 1mo ago | ||
| Netflix Prize 150k ratings | Accuracy (0.25 Quantile)61 | 10 | 1mo ago | ||
| Netflix Prize 100k ratings | Accuracy (0.25 Quantile)62 | 10 | 1mo ago | ||
| MovieLens 50k ratings | Accuracy (0.25 Quantile)59 | 10 | 1mo ago | ||
| MovieLens 1k ratings | Accuracy (0.25 Quantile)62 | 10 | 1mo ago | ||
| RewardBench 2 | Accuracy73.9 | 10 | 3mo ago | ||
| RM-Bench | C2 | Accuracy87.8 | 10 | 3mo ago | |
| Pets | SPL | Accuracy100 | 8 | 4mo ago | |
| UltraFeedback 500 held-out users (test) | RFM(32) | Test Accuracy70.53 | 7 | 4mo ago | |
| Sushi Preference Category A | Accuracy (Q0.25)68 | 5 | 1mo ago | ||
| Eigen-taste Jokes onehot variant | Accuracy (0.25 Q)61 | 5 | 1mo ago | ||
| HPSv3 (test) | HPSv3 | Accuracy74 | 5 | 2mo ago | |
| Meta-World Pick-Place (Novel Task) | ReCouPLe-EC | Reward Accuracy66.3 | 4 | 4mo ago | |
| Meta-World Pick-Place-Wall (train) | ReCouPLe-IC | Reward Accuracy65.7 | 4 | 4mo ago |