Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Medical Text Generation on MAQA (test)
Loading...
90.3
BERTScore
severity-aware multi-model framework
71.7984
76.6017
81.405
86.2083
Jun 3, 2026
BERTScore
Updated 1mo ago
Evaluation Results
Method
Method
Links
BERTScore
severity-aware multi-model framework
Training Mode=Fine-tuned
2026.06
90.3
Dialect-ar-gpt-2021
Training Mode=Fine-tuned
2026.06
86.74
severity-aware multi-model framework
Training Mode=Baseline
2026.06
86.71
Aragpt2-Base
Training Mode=Fine-tuned
2026.06
85.51
Aragpt2-Medium
Training Mode=Fine-tuned
2026.06
85.45
Qwen3-0.6B
Training Mode=Fine-tuned
2026.06
84.22
Bloomz-560M
Training Mode=Fine-tuned
2026.06
82.81
Qwen3-0.6B
Training Mode=Baseline
2026.06
82
Dialect-ar-gpt-2021
Training Mode=Baseline
2026.06
81.61
Aragpt2-Medium
Training Mode=Baseline
2026.06
79.69
Bloomz-560M
Training Mode=Baseline
2026.06
78.72
Aragpt2-Base
Training Mode=Baseline
2026.06
72.51
Feedback
Search any
task
Search any
task