Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-horizon memory Question Answering on LongBench
Loading...
73.7
Accuracy
GPT-4o (ceiling)
8.18
25.19
42.2
59.21
May 5, 2026
Accuracy
Updated 2mo ago
Evaluation Results
Method
Method
Links
Accuracy
GPT-4o (ceiling)
Backbone=GPT-4o, Answe...
2026.05
73.7
GPT-4o (matched)
Backbone=GPT-4o, Answe...
2026.05
64.7
MemFlow
Backbone=Qwen3-1.7B, A...
2026.05
51.1
RAG
Backbone=Qwen3-1.7B, A...
2026.05
46.7
ReAct
Backbone=Qwen3-1.7B, A...
2026.05
41.2
MemGPT
Backbone=Qwen3-1.7B, A...
2026.05
27.8
Direct QA (full)
Backbone=Qwen3-1.7B, A...
2026.05
19.8
Direct QA (short)
Backbone=Qwen3-1.7B, A...
2026.05
14.6
Memobase
Backbone=Qwen3-1.7B, A...
2026.05
10.7
Feedback
Search any
task
Search any
task