Full-Information Online Learning on FOL Gaussian rewards, Horizon Generalization [T=15 -> T=25] 1.0
57.36Max LRGPT-4o mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4o miniHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 57.36 | 27.42 | 0.67 | |
| Trained GPT-4o miniHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 53.29 | 25.63 | 0.62 | |
| FTRLHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 39.59 | 27.21 | 0.64 |