In-context adaptation on Wordle
6.23Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLTraining Strategy=Cross-task RL, Backbone=Qwen3-8B2026.06 | 6.23 | 11 | 0.61 | |
| Single-task RLTraining Strategy=Single-task RL, Backbone=Qwen3-8B2026.06 | 3.26 | 61 | 0.24 | |
| Base (Qwen3-8B)Training Strategy=None (Base Model), Backbone=Qwen3-8B2026.06 | 2.54 | 8 | 0.26 |