Non-Stationary Multi-Armed Bandits on NS-MAB Gradual Variation (LC=GPT, T=100, A=3)
427.91Max Learning RateGPT-4o mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4o ministatus=base model2025.11 | 427.91 | 96 | 18 | |
| Rexp32025.11 | 403.45 | 86 | 26 | |
| Trained GPT-4o minitraining_horizon=25, reward_process=Gradual Variation2025.11 | 370.02 | 91 | 22 |