Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-turn Decision Making on tau2-Bench held-out (test)
Loading...
41.9
Average Score
CURATEEVO
23.908
28.579
33.25
37.921
Jul 7, 2026
Average Score
Updated 17d ago
Evaluation Results
Method
Method
Links
Average Score
CURATEEVO
Model=QWEN3-4B, Data S...
2026.07
41.9
EnvScaler
Model=QWEN3-8B, Data S...
2026.07
37.9
CURATEEVO
Model=QWEN3-4B, Data S...
2026.07
37.2
EnvScaler
Model=QWEN3-8B, Data S...
2026.07
35.5
AWM
Model=QWEN3-8B, Data S...
2026.07
33.5
MUA-RL
Model=QWEN3-8B, Data S...
2026.07
32.8
GRPO w/o. Data Curation
Model=QWEN3-8B, Data S...
2026.07
31.8
AWM
Model=QWEN3-8B, Data S...
2026.07
31.8
RODS
Model=QWEN3-4B, Data S...
2026.07
31.6
MUA-RL
Model=QWEN3-8B, Data S...
2026.07
30.6
FunReason-MT
Model=QWEN3-4B, Data S...
2026.07
30.2
GRPO w/o. Data Curation
Model=QWEN3-8B, Data S...
2026.07
29.6
RODS
Model=QWEN3-4B, Data S...
2026.07
29.6
FunReason-MT
Model=QWEN3-4B, Data S...
2026.07
27.8
GRPO w/o. Data Curation
Model=QWEN3-4B, Data S...
2026.07
26.8
GRPO w/o. Data Curation
Model=QWEN3-4B, Data S...
2026.07
24.6
Feedback
Search any
task
Search any
task