In-context adaptation on Mastermind
7.13Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLTraining Strategy=Cross-task RL, Backbone=Qwen3-8B2026.06 | 7.13 | 3 | 0.7 | |
| Single-task RLTraining Strategy=Single-task RL, Backbone=Qwen3-8B2026.06 | 5.12 | 18 | 0.51 | |
| Base (Qwen3-8B)Training Strategy=None (Base Model), Backbone=Qwen3-8B2026.06 | 4.32 | 4 | 0.44 |