Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Sparse retrieval-style question answering on RULER synthetic QA (standard)
Loading...
0.3685
F1 Score
InfoMem
0.123664
0.187222
0.25078
0.314338
Jun 2, 2026
F1 Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
F1 Score
InfoMem
base_model=Qwen2.5-1.5...
2026.06
0.3685
Outcome-only GRPO
base_model=Qwen2.5-1.5...
2026.06
0.3474
ReMemR1
base_model=Qwen2.5-1.5...
2026.06
0.2892
Qwen2.5-1.5B-Instruct
status=Base Model
2026.06
0.1331
Feedback
Search any
task
Search any
task