Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Synthetic Long-context Reasoning on GraphWalks
Loading...
68.91
Accuracy
Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6K
38.1052
46.1026
54.1
62.0974
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-30B-A...
2026.06
68.91
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-30B-A...
2026.06
67.75
Qwen3-30B-A3B-Thinking-2507
Base Model=Qwen3-30B-A...
2026.06
66
Qwen3-30B-A3B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-30B-A...
2026.06
65.82
Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-4B-Th...
2026.06
49.74
Qwen3-4B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-4B-Th...
2026.06
49.42
Qwen3-4B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-4B-Th...
2026.06
48.7
Qwen3-4B-Thinking-2507
Base Model=Qwen3-4B-Th...
2026.06
48.67
Qwen3-8B-128K
Base Model=Qwen3-8B-12...
2026.06
42.27
Qwen3-8B-128K + KeyChain-15K
Base Model=Qwen3-8B-12...
2026.06
41.36
Qwen3-8B-128K + Data Recipe for Long-Context RL
Base Model=Qwen3-8B-12...
2026.06
40.96
Qwen3-8B-128K + DocQA-RL-1.6K
Base Model=Qwen3-8B-12...
2026.06
39.29
Feedback
Search any
task
Search any
task