| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| MT-Bench | Average Response Quality8.71 | 19 | 5mo ago | ||
| Controversial Topics (test) | DEBATUNE-13B | Win Score1.17 | 11 | 5mo ago | |
| Held-out n=300 (test) | DeBERTa Judge | Pearson Correlation Coefficient0.747 | 8 | 1mo ago | |
| DailyDialog, EmoryNLP, MELD, and IMEOCAP | Self-EmoQ | Fluency3.58 | 8 | 1mo ago | |
| AlpacaEval ELOM gpt4 (test) | (ai, ai+1) | ELOM1,629 | 7 | 5mo ago | |
| IFLLM 1.0 (test) | RF + (IF - Gaze) | DPO Win Rate53.54 | 6 | 1mo ago | |
| InPE Dataset | COPE | Win Rate60.4 | 4 | 17d ago | |
| OOD out-of-domain (150 samples) | GMM | Count102 | 4 | 19d ago | |
| ID in-domain (150 samples) | GMM | Count134 | 4 | 19d ago |