Reinforcement Learning on Secretary OOD-1
4.43Cumulative RewardSingle-task RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Single-task RL2026.06 | 4.43 | 5 | 0.43 | |
| BaseBackbone=Qwen3-8B2026.06 | 4.33 | 30 | 0.43 | |
| Cross-task RL2026.06 | 4.31 | 6 | 0.38 |
| Method | Links | |||
|---|---|---|---|---|
| Single-task RL2026.06 | 4.43 | 5 | 0.43 | |
| BaseBackbone=Qwen3-8B2026.06 | 4.33 | 30 | 0.43 | |
| Cross-task RL2026.06 | 4.31 | 6 | 0.38 |