Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-hop Question Answering on LB QA v1
Loading...
77.3
Accuracy
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
62.012
65.981
69.95
73.919
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-30B-A...
2026.06
77.3
Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-30B-A...
2026.06
68.9
Qwen3-8B-128K + Data Recipe for Long-Context RL
Base Model=Qwen3-8B-12...
2026.06
68.8
Qwen3-30B-A3B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-30B-A...
2026.06
68.4
Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-4B-Th...
2026.06
68.3
Qwen3-4B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-4B-Th...
2026.06
66.8
Qwen3-8B-128K + KeyChain-15K
Base Model=Qwen3-8B-12...
2026.06
66.5
Qwen3-30B-A3B-Thinking-2507
Base Model=Qwen3-30B-A...
2026.06
66.5
Qwen3-4B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-4B-Th...
2026.06
63.8
Qwen3-8B-128K + DocQA-RL-1.6K
Base Model=Qwen3-8B-12...
2026.06
63.7
Qwen3-8B-128K
Base Model=Qwen3-8B-12...
2026.06
62.9
Qwen3-4B-Thinking-2507
Base Model=Qwen3-4B-Th...
2026.06
62.6
Feedback
Search any
task
Search any
task