Non-Stationary Multi-Armed Bandits on NS-MAB Gradual Variation (LC=GPT, T=100, A=5)
560.95Max Learning RateRexp3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Rexp32025.11 | 560.95 | 88 | 46 | |
| GPT-4o ministatus=base model2025.11 | 453.72 | 90 | 32 | |
| Trained GPT-4o minitraining_horizon=25, reward_process=Gradual Variation2025.11 | 418.87 | 89 | 18 |