Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

FactScore

Benchmarks

Task NameDataset NameSOTA ResultTrend
Long-form FactualityFActScore
FActScore59.3
32
Factuality EvaluationFActScore
Pairwise Score84.5
24
Honesty EvaluationFActScore v1.0
Score47.3
20
Long-form text generationFactScore
FactScore68.1
20
Claim-level Uncertainty QuantificationFactScore English (test)
ROC-AUC71
20
Fact-checking of atomic claimsFactScore English
PR-AUC0.34
20
Knowledge Graph Factuality EvaluationFActScore
FActScore84
16
Long-form Factuality VerificationFactScore
Precision@165.41
15
Factual Text GenerationFactScore
AURC0.7345
14
long-form generationFActScore (test)
AUROC0.8581
12
Factuality GenerationFActScore (test)
Number of Facts20.4
12
Factuality EvaluationFactScore (unlabeled)
US (%)76.4
10
Factuality EvaluationFactScore (labeled)
LS Score (%)64.8
10
Factuality and Hallucination DetectionFactScore
FactScore96.1
9
Long-form Factuality CalibrationFactScore
ECE0.076
8
Consistency Assessment of Generated Reference PointsFactScore LLM-based evaluation
Score86.36
6
Long-form generationFactScore 200-word response length constraint
Response Coverage (%)98.9
5
Knowledge Graph Factuality EvaluationFActScore Context and General truth
FActScore80.2
2
Knowledge Graph Factuality EvaluationFActScore* Context only
FActScore76.9
2
Showing 19 of 19 rows