Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Information Retrieval Reasoning on NevIR
Loading...
0.617
Pairwise Accuracy
GPT-4o
0.23012
0.33056
0.431
0.53144
Apr 21, 2026
Pairwise Accuracy
Updated 3mo ago
Evaluation Results
Method
Method
Links
Pairwise Accuracy
GPT-4o
# Params.=—, Evaluatio...
2026.04
0.617
OpenAI o1
# Params.=—, Evaluatio...
2026.04
0.597
Llama 3.1 70B
# Params.=70B, Evaluat...
2026.04
0.588
MonoT5 3B
# Params.=3B, Evaluati...
2026.04
0.506
Llama 3.1 8B
# Params.=8B, Evaluati...
2026.04
0.422
Qwen2 7B
# Params.=7B, Evaluati...
2026.04
0.398
Llama 3.1 8B
# Params.=8B, Evaluati...
2026.04
0.379
RoBERTa-large
# Params.=355M, Evalua...
2026.04
0.343
Qwen2 7B
# Params.=7B, Evaluati...
2026.04
0.338
Llama 3.1 8B
# Params.=8B, Evaluati...
2026.04
0.306
Qwen2 7B
# Params.=7B, Evaluati...
2026.04
0.298
RoBERTa-large
# Params.=355M, Evalua...
2026.04
0.291
stsb-roberta-large
# Params.=355M, Evalua...
2026.04
0.249
RoBERTa-large
# Params.=355M, Evalua...
2026.04
0.245
Feedback
Search any
task
Search any
task