Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
CS research tasks on CoT 200-prompt (held-out test)
Loading...
77.4
Mean@3
Qwen3.5-4B RL on Agentic Self-Instruct data
62.424
66.312
70.2
74.088
Jun 24, 2026
Mean@3
Best@3
Updated 1mo ago
Evaluation Results
Method
Method
Links
Mean@3
Best@3
Qwen3.5-4B RL on Agentic Self-Instruct data
Algorithm=GRPO, Data s...
2026.06
77.4
89.4
Qwen3.5-4B RL on CoT Self-Instruct data
Algorithm=GRPO, Data s...
2026.06
72.7
85.3
Qwen3.5-4B
RL Training=None
2026.06
63
75.8
Feedback
Search any
task
Search any
task