Reinforcement Learning on Number guessing (OOD-2)
3.57Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 3.57 | 9 | 0.32 | |
| Qwen3-8BModel Type=Base2026.06 | 2.97 | 45 | 0.18 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 3.57 | 9 | 0.32 | |
| Qwen3-8BModel Type=Base2026.06 | 2.97 | 45 | 0.18 |