Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Laboratory-language grounding on LabGuard-Bench 1.0 (source-held-out)
Loading...
79.4
Tag F1
LabGuard-Hybrid
53.92
60.535
67.15
73.765
Jun 30, 2026
Tag F1
Pred Soft
Pred EM
Updated 25d ago
Evaluation Results
Method
Method
Links
Tag F1
Pred Soft
Pred EM
LabGuard-Hybrid
2026.06
79.4
36.7
23.1
Base Grounder + Constraint decoding
Backbone=Qwen3-8B, Dec...
2026.06
77.8
34.2
21.3
Base Grounder + LoRA fine-tuning
Backbone=Qwen3-8B, Fin...
2026.06
75.3
31.8
19.6
Qwen2.5-72B
Evaluation Protocol=0-...
2026.06
68.9
29.1
16.3
DeepSeek-V3.1
Evaluation Protocol=0-...
2026.06
67.2
27.3
14.9
Qwen3-32B
Evaluation Protocol=0-...
2026.06
64.8
24.7
13.1
Base Grounder
Backbone=Qwen3-8B
2026.06
62.4
18.7
11.4
Qwen-7B
Evaluation Protocol=0-...
2026.06
61.3
20.4
10.2
Regex BL
2026.06
58.7
28.5
15.8
SciBERT
Backbone=SciBERT
2026.06
54.9
14.2
7.6
Feedback
Search any
task
Search any
task