Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Synthetic Long-context Reasoning on LongReason
Loading...
84.89
Accuracy
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
67.1996
71.7923
76.385
80.9777
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-30B-A...
2026.06
84.89
Qwen3-30B-A3B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-30B-A...
2026.06
84.76
Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-4B-Th...
2026.06
82.12
Qwen3-30B-A3B-Thinking-2507
Base Model=Qwen3-30B-A...
2026.06
81.61
Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-30B-A...
2026.06
80.86
Qwen3-4B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-4B-Th...
2026.06
76.2
Qwen3-8B-128K + Data Recipe for Long-Context RL
Base Model=Qwen3-8B-12...
2026.06
73.93
Qwen3-8B-128K + KeyChain-15K
Base Model=Qwen3-8B-12...
2026.06
72.04
Qwen3-4B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-4B-Th...
2026.06
71.28
Qwen3-4B-Thinking-2507
Base Model=Qwen3-4B-Th...
2026.06
69.5
Qwen3-8B-128K
Base Model=Qwen3-8B-12...
2026.06
68.26
Qwen3-8B-128K + DocQA-RL-1.6K
Base Model=Qwen3-8B-12...
2026.06
67.88
Feedback
Search any
task
Search any
task