Non-Stationary Multi-Armed Bandits on NS-MAB Gradual Variation (T=50, A=3)
277.74Max Learning RateGPT-4o mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4o ministatus=base model2025.11 | 277.74 | 0.88 | 22 | |
| Rexp32025.11 | 214.1 | 0.89 | 32 | |
| Trained GPT-4o minitraining_horizon=25, reward_process=Gradual Variation2025.11 | 204.74 | 0.86 | 22 |