Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-turn Dialogue Evaluation on MT-Bench OOD
Loading...
8.64
R1 Score
Prompt
3.9288
5.1519
6.375
7.5981
Jun 22, 2026
R1 Score
R2 Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
R1 Score
R2 Score
Prompt
Model=Deepseek-V4-Flas...
2026.06
8.64
8.06
Prompt
Model=Qwen3-32B, Categ...
2026.06
8.58
8.06
Prompt
Model=Qwen3-8B, Catego...
2026.06
8.04
7.04
SFT
Model=Qwen3-8B, Catego...
2026.06
7.96
7.43
Prompt
Model=Qwen3-4B, Catego...
2026.06
7.82
6.82
EvoRubrics
Model=Qwen3-4B, Catego...
2026.06
7.74
7.11
RuscaRL
Model=Qwen3-4B, Catego...
2026.06
7.64
6.71
OnlineRubrics
Model=Qwen3-8B, Catego...
2026.06
7.6
6.71
SFT
Model=Qwen3-4B, Catego...
2026.06
7.5
6.44
EvoRubrics
Model=Qwen3-8B, Catego...
2026.06
7.48
7.05
GoldenRubrics
Model=Qwen3-8B, Catego...
2026.06
7.25
6.63
OnlineRubrics
Model=Qwen3-4B, Catego...
2026.06
6.4
4.33
GoldenRubrics
Model=Qwen3-4B, Catego...
2026.06
6.04
4.01
RuscaRL
Model=Qwen3-8B, Catego...
2026.06
4.11
3.4
Feedback
Search any
task
Search any
task