Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Tool-use Reasoning on ShopTrajQA 32k context
Loading...
62.6
Accuracy
gpt-oss-120B
11.848
25.024
38.2
51.376
Jun 6, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
gpt-oss-120B
Inference Mode=pure text
2026.06
62.6
Qwen3-4B-SFT-RLVR
Training Stage=SFT-RLVR
2026.06
62.5
Qwen3-1.7B-SFT-RLVR
Training Stage=SFT-RLVR
2026.06
59.2
Qwen3-4B
Inference Mode=pure text
2026.06
48
Qwen3-Coder-30B
Inference Mode=pure text
2026.06
38.4
Qwen3-4B-SFT
Training Stage=SFT
2026.06
36.4
gpt-oss-120B
Inference Mode=tool-ca...
2026.06
28.7
Qwen3-1.7B-SFT
Training Stage=SFT
2026.06
28.1
Qwen3-Coder-30B
Inference Mode=tool-ca...
2026.06
25
Qwen3-1.7B
Inference Mode=pure text
2026.06
23
gpt-oss-20B
Inference Mode=pure text
2026.06
22.3
Qwen3-1.7B
Inference Mode=tool-ca...
2026.06
17.3
gpt-oss-20B
Inference Mode=tool-ca...
2026.06
17.1
Qwen3-4B
Inference Mode=tool-ca...
2026.06
13.8
Feedback
Search any
task
Search any
task