In-context adaptation on Hangman
6.48Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLTraining Strategy=Cross-task RL, Backbone=Qwen3-8B2026.06 | 6.48 | 5 | 0.65 | |
| Single-task RLTraining Strategy=Single-task RL, Backbone=Qwen3-8B2026.06 | 5.53 | 5 | 0.55 | |
| Base (Qwen3-8B)Training Strategy=None (Base Model), Backbone=Qwen3-8B2026.06 | 3.47 | 3 | 0.33 |