Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

LongMemEval

Benchmarks

Task NameDataset NameSOTA ResultTrend
Long-context Memory EvaluationLongMemEval
Average Score95.6
103
Long-context Question AnsweringLongMemEval LongConvQA
SH Score90.3
84
Evidence-round recallLongMemEval 100 question sample
Evidence-round Recall100
48
Long-term conversational memoryLongMemEval Small
F1 Score (%)51.2
40
Memory-augmented language modeling evaluationLONGMEMEVAL-S
Accuracy73.2
31
Long-term MemoryLongMemEval
Score90.8
30
Long-term Memory EvaluationLongMemEval S (test)
KU (Knowledge Update)94.4
30
RetrievalLongMemEval
Recall@599
25
MemoryLongMemEval
Accuracy34.72
25
Dialogue-Style Memory ReasoningLongMemEval
EM65.92
24
Dialogue Memory AccuracyLongMemEval-S (N=500)
Temporal Accuracy91
24
Long-term Memory EvaluationLongMemEvalS
Overall Score95.6
23
Memory Question AnsweringLongMemEval
Accuracy76
22
Long-context Memory Retrieval and ReasoningLongMemEval 1M
F1 Score49.58
20
Long-context Memory Retrieval and ReasoningLongMemEval 128K
F1 Score47.26
20
End-to-End PerformanceLongMemEval
Top-5 Recall59.9
20
Runtime Agent MemoryLongMemEval
F1 Score40.53
20
Question AnsweringLongMemEval S (test)
QA Score (TR Context)84.21
19
Long-term Memory RetrievalLongMemEval-S
SSU100
19
Long context memory managementLongMemEval
Precision68.5
18
Long-term dialogue memoryLongMemEval (test)
Accuracy85.75
18
Long-term memory evaluationLongMemEval S
Single-User Score97.14
17
RetrievalLongMemEval-S
Recall@594.68
17
Long-horizon Question AnsweringLongMemEval-RR
F1 Score46.33
16
Long-term Memory Question AnsweringLongMemEval-S (500 questions)
KU Accuracy98.7
16
Showing 25 of 121 rows