Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Scientific Reasoning Tasks CoT Self-Instruct Starting Qwen3.5-4B model
Loading...
80.22
Average Score @8
Agentic Self-Instruct
77.048
77.8715
78.695
79.5185
Jun 24, 2026
Average Score @8
Pass Rate @8
Performance Delta
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average Score @8
Pass Rate @8
Performance Delta
Agentic Self-Instruct
Training Data Source=A...
2026.06
80.22
94.36
3.05
Combined (2× data)
Training Data Source=C...
2026.06
79.66
93.5
2.49
CoT Self-Instruct
Training Data Source=C...
2026.06
79.03
92.77
1.86
Qwen3.5-4B
Training Data Source=B...
2026.06
77.17
92.52
-
Feedback
Search any
task
Search any
task