Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Legal Reasoning on PRBench-Legal Hard 250-prompt
Loading...
31.5
GPT-5 Grader Score
Qwen3.5-4B RL on Agentic Self-Instruct data
16.108
20.104
24.1
28.096
Jun 24, 2026
GPT-5 Grader Score
Kimi-K2.6 Grader Score
Updated 1mo ago
Evaluation Results
Method
Method
Links
GPT-5 Grader Score
Kimi-K2.6 Grader Score
Qwen3.5-4B RL on Agentic Self-Instruct data
RL training data=Agent...
2026.06
31.5
26.6
Qwen3.5-397B
RL training data=no ad...
2026.06
27.7
22.6
Qwen3.5-4B RL on CoT Self-Instruct data
RL training data=CoT S...
2026.06
25.3
23.3
Qwen3.5-4B
RL training data=no ad...
2026.06
16.7
14.5
Feedback
Search any
task
Search any
task