Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Persona-Scenario

Benchmarks

Task NameDataset NameSOTA ResultTrend
Dialogue NaturalnessPersona-Scenario
GPT-Score: Fluency98.55
3
Dialogue Goal CompletionPersona-Scenario
Believability (Sotopia-Eval)9.19
3
Dialogue Quality EvaluationPersona-Scenario
Believability3.7
3
Showing 3 of 3 rows