Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Corpus-level evidence aggregation on CorpusQA 128K-token
Loading...
19.453
LLM-as-Judge Accuracy
InfoMem
0.80268
5.64459
10.4865
15.32841
Jun 2, 2026
LLM-as-Judge Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
LLM-as-Judge Accuracy
InfoMem
base_model=Qwen2.5-1.5...
2026.06
19.453
Outcome-only GRPO
base_model=Qwen2.5-1.5...
2026.06
16.413
Qwen2.5-1.5B-Instruct
status=Base Model
2026.06
14.59
ReMemR1
base_model=Qwen2.5-1.5...
2026.06
1.52
Feedback
Search any
task
Search any
task