Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Natural Language Inference on MNLI Neg
Loading...
75
Accuracy
GPT-4o
45.88
53.44
61
68.56
Apr 21, 2026
Accuracy
Updated 3mo ago
Evaluation Results
Method
Method
Links
Accuracy
GPT-4o
# Params.=—, Evaluatio...
2026.04
75
OpenAI o1
# Params.=—, Evaluatio...
2026.04
74.6
RoBERTa-large-NSP
# Params.=355M, Evalua...
2026.04
69.9
RoBERTa-large
# Params.=355M, Evalua...
2026.04
69.9
RoBERTa-large
# Params.=355M, Evalua...
2026.04
69.7
RoBERTa-large
# Params.=355M, Evalua...
2026.04
69.4
Qwen2 7B
# Params.=7B, Evaluati...
2026.04
67.5
Llama 3.1 70B
# Params.=70B, Evaluat...
2026.04
65.9
Llama 3.1 8B
# Params.=8B, Evaluati...
2026.04
63.9
Qwen2 7B
# Params.=7B, Evaluati...
2026.04
63
BERTNOT
# Params.=110M, Evalua...
2026.04
60.9
Qwen2 7B
# Params.=7B, Evaluati...
2026.04
59.5
Llama 3.1 8B
# Params.=8B, Evaluati...
2026.04
51.1
Llama 3.1 8B
# Params.=8B, Evaluati...
2026.04
47
Feedback
Search any
task
Search any
task