Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-horizon memory Question Answering on LongMemEval
Loading...
68.4
Accuracy
GPT-4o (ceiling)
11.2
26.05
40.9
55.75
May 5, 2026
Accuracy
Updated 2mo ago
Evaluation Results
Method
Method
Links
Accuracy
GPT-4o (ceiling)
Backbone=GPT-4o, Answe...
2026.05
68.4
GPT-4o (matched)
Backbone=GPT-4o, Answe...
2026.05
67.8
MemFlow
Backbone=Qwen3-1.7B, A...
2026.05
61.8
ReAct
Backbone=Qwen3-1.7B, A...
2026.05
50.2
RAG
Backbone=Qwen3-1.7B, A...
2026.05
46
Direct QA (full)
Backbone=Qwen3-1.7B, A...
2026.05
42.2
MemGPT
Backbone=Qwen3-1.7B, A...
2026.05
38.8
Direct QA (short)
Backbone=Qwen3-1.7B, A...
2026.05
34.2
Memobase
Backbone=Qwen3-1.7B, A...
2026.05
13.4
Feedback
Search any
task
Search any
task