Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Hangman

Benchmarks

Task NameDataset NameSOTA ResultTrend
Reinforcement LearningHangman OOD-1
Cumulative Reward6.84
3
In-context adaptationHangman
Cumulative Reward6.48
3
Reinforcement LearningHangman (OOD-2)
Cumulative Reward5.65
2
Showing 3 of 3 rows