Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Holistic Long-context Reasoning on DocFinQA
Loading...
51.63
Accuracy
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
35.1564
39.4332
43.71
47.9868
Jun 17, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Qwen3-30B-A3B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-30B-A...
2026.06
51.63
Qwen3-30B-A3B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-30B-A...
2026.06
51.41
Qwen3-30B-A3B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-30B-A...
2026.06
50
Qwen3-4B-Thinking-2507 + Data Recipe for Long-Context RL
Base Model=Qwen3-4B-Th...
2026.06
48.37
Qwen3-4B-Thinking-2507 + DocQA-RL-1.6K
Base Model=Qwen3-4B-Th...
2026.06
48.05
Qwen3-4B-Thinking-2507 + KeyChain-15K
Base Model=Qwen3-4B-Th...
2026.06
47.29
Qwen3-30B-A3B-Thinking-2507
Base Model=Qwen3-30B-A...
2026.06
41.11
Qwen3-4B-Thinking-2507
Base Model=Qwen3-4B-Th...
2026.06
39.8
Qwen3-8B-128K + Data Recipe for Long-Context RL
Base Model=Qwen3-8B-12...
2026.06
39.59
Qwen3-8B-128K
Base Model=Qwen3-8B-12...
2026.06
38.83
Qwen3-8B-128K + DocQA-RL-1.6K
Base Model=Qwen3-8B-12...
2026.06
37.96
Qwen3-8B-128K + KeyChain-15K
Base Model=Qwen3-8B-12...
2026.06
35.79
Feedback
Search any
task
Search any
task