Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Tool-use Reasoning on ShopTrajQA 64k context
Loading...
60.1
Accuracy
Qwen3-4B-SFT-RLVR
7.268
20.984
34.7
48.416
Jun 6, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Qwen3-4B-SFT-RLVR
Training Stage=SFT-RLVR
2026.06
60.1
gpt-oss-120B
Inference Mode=pure text
2026.06
57.2
Qwen3-1.7B-SFT-RLVR
Training Stage=SFT-RLVR
2026.06
51
Qwen3-4B
Inference Mode=pure text
2026.06
47.6
Qwen3-4B-SFT
Training Stage=SFT
2026.06
41
gpt-oss-120B
Inference Mode=tool-ca...
2026.06
35.5
Qwen3-1.7B-SFT
Training Stage=SFT
2026.06
27.7
Qwen3-Coder-30B
Inference Mode=pure text
2026.06
24.7
Qwen3-Coder-30B
Inference Mode=tool-ca...
2026.06
22.4
gpt-oss-20B
Inference Mode=pure text
2026.06
21.4
gpt-oss-20B
Inference Mode=tool-ca...
2026.06
18.8
Qwen3-1.7B
Inference Mode=tool-ca...
2026.06
14.7
Qwen3-4B
Inference Mode=tool-ca...
2026.06
9.3
Feedback
Search any
task
Search any
task