Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

MSC

Benchmarks

Task NameDataset NameSOTA ResultTrend
Dialogue Response GenerationMSC
B-4 Score35.8
38
Membership Inference AttackMSC
ROC-AUC1
24
Multi-Turn Dialogue GenerationMSC (test)
PPL8.431
14
Dialogue Response GenerationMSC Session 3
BLEU-1 Score24.18
10
Language ModelingMSC Session Openings 1.0 (val)
Perplexity7.78
10
Language ModelingMSC Session 5 1.0 (val)
Perplexity8.99
10
Language ModelingMSC Session 4 1.0 (val)
Perplexity9.07
10
Language ModelingMSC Session 3 1.0 (val)
Perplexity8.96
10
Language ModelingMSC Session 2 1.0 (val)
Perplexity9.08
10
Language ModelingMSC Session 1 1.0 (val)
Perplexity8.14
10
Dialogue Response GenerationMSC Average
BLEU-120.01
5
Dialogue Response GenerationMSC Session 5
BLEU-120.57
5
Dialogue Response GenerationMSC Session 4
BLEU-120.19
5
Dialogue Response GenerationMSC Session 2
BLEU-119.54
5
Text GenerationMSC
SacreBLEU1.23
5
Conversational MemoryMSC
RP@1077.2
5
Dialogue GenerationMSC N=100 (test)
Coherence4.85
4
Multi-Turn Dialogue GenerationMSC
Perplexity (PPL)8.385
4
RetrievalMSC persona
R@1099.2
4
Sparse Matrix-Vector multiplicationmsc10848
Memory (MB)1,014.04
4
Speech Mask DetectionMSC (test)
UAR72.5
3
Head-to-Head Comparative EvaluationMSC (test)
Wins289
2
Conversational Quality Evaluation (Conversational Turns)MSC 10% human-annotated sample
Topic Consistency64.12
1
Pulmonary nodule diagnosisMSC
AUC0.927
1
Showing 24 of 24 rows