In-context adaptation on Number guessing
5.78Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLTraining Strategy=Cross-task RL, Backbone=Qwen3-8B2026.06 | 5.78 | 75 | 0.63 | |
| Single-task RLTraining Strategy=Single-task RL, Backbone=Qwen3-8B2026.06 | 3.36 | 11 | 0.31 | |
| Base (Qwen3-8B)Training Strategy=None (Base Model), Backbone=Qwen3-8B2026.06 | 2.23 | 18 | 0.18 |