Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

MMHal-Bench

Benchmarks

Task NameDataset NameSOTA ResultTrend
Hallucination EvaluationMMHal-Bench
MMHal Score84.2
309
Multimodal Hallucination EvaluationMMHal-Bench
Average Score46
140
Image+Text-to-Text Hallucination EvaluationMMHal-Bench
BERT Score79
18
Vision-Language HallucinationMMHal-Bench
Hal32
13
Generative Hallucination MitigationMMHal-Bench
Overall Score3.49
13
Multi-modal Hallucination EvaluationMMHal-Bench v1.0 (test)
Overall Score2.14
12
Hallucination EvaluationMMHal-Bench-V
Hallucination Score2.57
9
Multi-modal Hallucination EvaluationMMHal-Bench
Attribute Failure Score1.83
5
Showing 8 of 8 rows