| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| Audio-OpenHermes | SEA-LION-v3-8B-IT | EN Score4.44 | 10 | 4mo ago | |
| AlpacaEval Audio | SEA-LION-v3-8B-IT | EN Score4.59 | 10 | 4mo ago | |
| BPO Eval (test) | BPO + Vicuna-v1.3 13B | Win Rate (A)59.5 | 7 | 4mo ago | |
| Dolly Eval | BPO + Llama-2-chat 13B (Cross-size) | A Win Rate54 | 7 | 4mo ago | |
| Self-instruct Eval | BPO + Llama-2-chat 7B | Win Rate (A)53.6 | 7 | 4mo ago | |
| Vicuna Eval v1.3 (test) | BPO + Vicuna-v1.3 7B | A Win Rate65 | 7 | 4mo ago | |
| SuperNI | GRID | Average Accuracy48.12 | 6 | 1mo ago | |
| WildBench v2 | SEE | Win Rate58.1 | 3 | 1mo ago | |
| Arena-Hard-Auto v2.0 | SEE | Win Rate (Response)51.8 | 3 | 1mo ago | |
| LC AlpacaEval 2.0 | SEE | Response Win-rate59.2 | 3 | 1mo ago | |
| AlpacaEval GPT-5.2-judged (test) | Hybrid KD | Win Rate64.4 | 3 | 1mo ago |