Reinforcement Learning on Wordladder (OOD-2)
5.15Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 5.15 | 4 | 0.51 | |
| Qwen3-8BModel Type=Base2026.06 | 4.58 | 11 | 0.47 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 5.15 | 4 | 0.51 | |
| Qwen3-8BModel Type=Base2026.06 | 4.58 | 11 | 0.47 |