Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Question Answering on LongMemEval MAB
Loading...
72
LLM-judge Accuracy
SEGTREEMEM
50.888
56.369
61.85
67.331
Jun 3, 2026
LLM-judge Accuracy
Token-level F1
Updated 1mo ago
Evaluation Results
Method
Method
Links
LLM-judge Accuracy
Token-level F1
SEGTREEMEM
Variant=Best, Backbone...
2026.06
72
14.4
SEGTREEMEM
Variant=No-Propagation...
2026.06
66.9
12.8
HippoRAG
Variant=Default, Backb...
2026.06
61.2
14.2
A-MEM
Variant=Default, Backb...
2026.06
59.9
13.9
RAPTOR
Variant=Default, Backb...
2026.06
59.3
14
Dense
Variant=Default, Backb...
2026.06
59
14
MemTree
Variant=Default, Backb...
2026.06
54.3
13.7
BM25
Variant=Default, Backb...
2026.06
54.2
13.7
Mem0
Variant=Default, Backb...
2026.06
51.7
14.7
Feedback
Search any
task
Search any
task