Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Narrow finetuning on Auto
Loading...
83.4
EM-F1
TReFT
52.2
60.3
68.4
76.5
Jun 4, 2026
EM-F1
Utilization Change (ΔUtil)
Updated 1mo ago
Evaluation Results
Method
Method
Links
EM-F1
Utilization Change (ΔUtil)
TReFT
Model=Qwen-2.5-32B
2026.06
83.4
-0.2
TReFT
Model=Llama-3.1-8B
2026.06
77.9
0.4
TReFT
Model=Qwen-2.5-7B
2026.06
76.5
1.6
Data interleaving
Model=Qwen-2.5-32B
2026.06
74.9
-1
TReFT
Model=GPT-OSS-20B
2026.06
74.3
-0.81
Data interleaving
Model=Qwen-2.5-7B
2026.06
70.9
0.3
Data interleaving
Model=Llama-3.1-8B
2026.06
70.2
0.2
SFT
Model=Qwen-2.5-7B
2026.06
68.6
0.6
SFT
Model=GPT-OSS-20B
2026.06
64
-2.77
Data interleaving
Model=GPT-OSS-20B
2026.06
63.6
-1.46
SFT
Model=Llama-3.1-8B
2026.06
54.2
-1
SFT
Model=Qwen-2.5-32B
2026.06
53.4
-2
Feedback
Search any
task
Search any
task