In-context adaptation on Wordladder
9.2Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLTraining Strategy=Cross-task RL, Backbone=Qwen3-8B2026.06 | 9.2 | 1 | 0.93 | |
| Single-task RLTraining Strategy=Single-task RL, Backbone=Qwen3-8B2026.06 | 8.8 | 2 | 0.88 | |
| Base (Qwen3-8B)Training Strategy=None (Base Model), Backbone=Qwen3-8B2026.06 | 5.35 | 5 | 0.54 |