Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Evidence Retrieval on Factiverse Evaluation Dataset
Loading...
82.16
F1 Score
XLM-RoBERTa-Large (FT)
52.26
60.0225
67.785
75.5475
Jun 7, 2026
F1 Score
Recall
Precision
Updated 1mo ago
Evaluation Results
Method
Method
Links
F1 Score
Recall
Precision
XLM-RoBERTa-Large (FT)
Provider=Factiverse
2026.06
82.16
94.29
72.79
pplx-embed-v1-4b
Provider=Perplexity
2026.06
81.77
79.05
84.69
pplx-embed-v1-0.6b
Provider=Perplexity
2026.06
79.79
71.43
90.36
text-embedding-3-large
Provider=OpenAI
2026.06
79.59
74.29
85.71
Qwen3-Embedding-0.6B
Provider=Qwen
2026.06
76.52
96.19
63.52
Qwen3-Embedding-4B
Provider=Qwen
2026.06
75
88.57
65.03
embeddinggemma-300m
Provider=Google
2026.06
53.41
89.52
38.06
Feedback
Search any
task
Search any
task