Reinforcement Learning on Number guessing OOD-1
6.11Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 6.11 | 23 | 0.59 | |
| Single-task RL2026.06 | 4.03 | 9 | 0.39 | |
| BaseBackbone=Qwen3-8B2026.06 | 2.82 | 49 | 0.18 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 6.11 | 23 | 0.59 | |
| Single-task RL2026.06 | 4.03 | 9 | 0.39 | |
| BaseBackbone=Qwen3-8B2026.06 | 2.82 | 49 | 0.18 |