Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Function Calling on BFCL held-out V4 (test)
Loading...
52.4
Average Score
CURATEEVO
10.904
21.677
32.45
43.223
Jul 7, 2026
Average Score
Updated 18d ago
Evaluation Results
Method
Method
Links
Average Score
CURATEEVO
Model=QWEN3-4B, Data S...
2026.07
52.4
FunReason-MT
Model=QWEN3-4B, Data S...
2026.07
50.3
CURATEEVO
Model=QWEN3-4B, Data S...
2026.07
50
FunReason-MT
Model=QWEN3-4B, Data S...
2026.07
48.7
EnvScaler
Model=QWEN3-8B, Data S...
2026.07
47.6
RODS
Model=QWEN3-4B, Data S...
2026.07
47.2
EnvScaler
Model=QWEN3-8B, Data S...
2026.07
46.2
RODS
Model=QWEN3-4B, Data S...
2026.07
45.9
MUA-RL
Model=QWEN3-8B, Data S...
2026.07
42.6
MUA-RL
Model=QWEN3-8B, Data S...
2026.07
40.9
AWM
Model=QWEN3-8B, Data S...
2026.07
39.7
AWM
Model=QWEN3-8B, Data S...
2026.07
38.4
GRPO w/o. Data Curation
Model=QWEN3-8B, Data S...
2026.07
18.7
GRPO w/o. Data Curation
Model=QWEN3-8B, Data S...
2026.07
17.4
GRPO w/o. Data Curation
Model=QWEN3-4B, Data S...
2026.07
13.8
GRPO w/o. Data Curation
Model=QWEN3-4B, Data S...
2026.07
12.5
Feedback
Search any
task
Search any
task