Reinforcement Learning on Wordle OOD-1
5.07Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 5.07 | 21 | 0.57 | |
| Single-task RL2026.06 | 3.07 | 53 | 0.26 | |
| BaseBackbone=Qwen3-8B2026.06 | 2.13 | 41 | 0.19 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 5.07 | 21 | 0.57 | |
| Single-task RL2026.06 | 3.07 | 53 | 0.26 | |
| BaseBackbone=Qwen3-8B2026.06 | 2.13 | 41 | 0.19 |