Reinforcement Learning on Hangman (OOD-2)
5.65Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 5.65 | 5 | 0.58 | |
| Qwen3-8BModel Type=Base2026.06 | 4.68 | 33 | 0.48 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 5.65 | 5 | 0.58 | |
| Qwen3-8BModel Type=Base2026.06 | 4.68 | 33 | 0.48 |