Full-Information Online Learning on FOL Sine-trend rewards Horizon Generalization [T=15 -> T=25] 1.0
40.62Max LRGPT-4o mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4o miniHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 40.62 | 11.24 | 0.43 | |
| Trained GPT-4o miniHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 39.64 | 9.83 | 0.38 | |
| FTRLHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 38.09 | 11.32 | 0.43 |