Reinforcement Learning on Hangman OOD-1
6.84Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 6.84 | 30 | 0.7 | |
| Single-task RL2026.06 | 5.9 | 17 | 0.61 | |
| BaseBackbone=Qwen3-8B2026.06 | 5.54 | 88 | 0.6 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 6.84 | 30 | 0.7 | |
| Single-task RL2026.06 | 5.9 | 17 | 0.61 | |
| BaseBackbone=Qwen3-8B2026.06 | 5.54 | 88 | 0.6 |