Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-horizon Dialogue Memory Tracking on LongMemEval 115K-token S
Loading...
12.8
LLM-as-Judge Accuracy
InfoMem
5.312
7.256
9.2
11.144
Jun 2, 2026
LLM-as-Judge Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
LLM-as-Judge Accuracy
InfoMem
base_model=Qwen2.5-1.5...
2026.06
12.8
Outcome-only GRPO
base_model=Qwen2.5-1.5...
2026.06
10
ReMemR1
base_model=Qwen2.5-1.5...
2026.06
6.2
Qwen2.5-1.5B-Instruct
status=Base Model
2026.06
5.6
Feedback
Search any
task
Search any
task