Reinforcement Learning on Secretary (OOD-2)
4.84Cumulative RewardCross-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 4.84 | 32 | 0.49 | |
| Qwen3-8BModel Type=Base2026.06 | 4.76 | 24 | 0.47 |
| Method | Links | |||
|---|---|---|---|---|
| Cross-task RLModel Type=LOO, Evaluation Protocol=Leave-one-out2026.06 | 4.84 | 32 | 0.49 | |
| Qwen3-8BModel Type=Base2026.06 | 4.76 | 24 | 0.47 |