Reinforcement Learning on Mastermind OOD-1
4.29Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 4.29 | 10 | 0.43 | |
| Single-task RL2026.06 | 3.48 | 10 | 0.35 | |
| BaseBackbone=Qwen3-8B2026.06 | 3.46 | 13 | 0.34 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RL2026.06 | 4.29 | 10 | 0.43 | |
| Single-task RL2026.06 | 3.48 | 10 | 0.35 | |
| BaseBackbone=Qwen3-8B2026.06 | 3.46 | 13 | 0.34 |