Multi-Armed Bandit (MAB) Horizon Generalization T=100
22.37Average RegretIterative RMFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Iterative RMFTBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=100, Budget type=IMk2025.11 | 22.37 | |
| AD_2IMLBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=100, Budget type=2IML2025.11 | 32.97 | |
| AD_IMLBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=100, Budget type=IML2025.11 | 33.44 | |
| GRPO_stepBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=1002025.11 | 35.88 | |
| GRPO_regretBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=100, Budget type=IMk2025.11 | 40.09 | |
| BaseBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=1002025.11 | 52.1 | |
| AD_IMkBackbone=Qwen3-8B, Teacher setup=UCB teacher, Training Horizon (T)=25, Evaluation Horizon (T)=100, Budget type=IMk2025.11 | 58.72 |