Reinforcement Learning on Wordladder OOD-1
9.35Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 9.35 | 1 | 0.93 | |
| Single-task RL2026.06 | 9.25 | 4 | 0.91 | |
| BaseBackbone=Qwen3-8B2026.06 | 7.42 | 6 | 0.74 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 9.35 | 1 | 0.93 | |
| Single-task RL2026.06 | 9.25 | 4 | 0.91 | |
| BaseBackbone=Qwen3-8B2026.06 | 7.42 | 6 | 0.74 |