Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
In-context adaptation on Number guessing
Loading...
5.78
Cumulative Reward
Cross-task RL
2.088
3.0465
4.005
4.9635
Jun 13, 2026
Cumulative Reward
Gain (%)
Final Reward
Updated 1mo ago
Evaluation Results
Method
Method
Links
Cumulative Reward
Gain (%)
Final Reward
Cross-task RL
Training Strategy=Cros...
2026.06
5.78
75
0.63
Single-task RL
Training Strategy=Sing...
2026.06
3.36
11
0.31
Base (Qwen3-8B)
Training Strategy=None...
2026.06
2.23
18
0.18
Feedback
Search any
task
Search any
task