Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Scientific Reasoning Tasks

Benchmarks

Task NameDataset NameSOTA ResultTrend
Scientific ReasoningScientific Reasoning Tasks CoT Self-Instruct Starting Qwen3.5-4B model
Average Score @880.22
4
Scientific ReasoningScientific Reasoning Tasks Agentic subset Starting Qwen3.5-4B model
Avg@856.79
4
Scientific ReasoningScientific Reasoning Tasks Starting Qwen3.5-4B model (Overall)
Average Score @871.86
4
Showing 3 of 3 rows