Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Text Classification on SST-5, MRPC, QNLI, SWAG, IMDB, DBPedia, BoolQ (test) (OpenAI Embeddings)
Loading...
83.5
Accuracy
Kite
78.82
80.035
81.25
82.465
Sep 19, 2025
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Kite
Model=Claude-Haiku-4.5...
2025.09
83.5
Kite
Model=GPT-5.2, r=5, Te...
2025.09
82.9
CEIL
Model=Claude-Haiku-4.5...
2025.09
82.8
KNN
Model=Claude-Haiku-4.5...
2025.09
82.3
Kite
Model=GPT-4.1, r=5, Te...
2025.09
82.2
CEIL
Model=GPT-5.2, r=5, Te...
2025.09
81.7
KNN
Model=GPT-5.2, r=5, Te...
2025.09
81.6
Kite
Model=GPT-4o-mini, r=5...
2025.09
81.3
KNN
Model=GPT-4.1, r=5, Te...
2025.09
81.2
CEIL
Model=GPT-4.1, r=5, Te...
2025.09
81.2
BM25
Model=Claude-Haiku-4.5...
2025.09
81.1
BM25
Model=GPT-4.1, r=5, Te...
2025.09
80.7
KNN
Model=GPT-4o-mini, r=5...
2025.09
80.5
CEIL
Model=GPT-4o-mini, r=5...
2025.09
80.4
BM25
Model=GPT-5.2, r=5, Te...
2025.09
79.7
BM25
Model=GPT-4o-mini, r=5...
2025.09
79
Feedback
Search any
task
Search any
task