Horizon Generalization on FOL Uniform reward
227.48Max LRGemma-2-9b-it
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gemma-2-9b-itHorizon Shift=T=25 to T=50, Backbone=Gemma-2-9b-it2025.11 | 227.48 | 28.47 | 81 | |
| Trained Gemma-2-9b-itHorizon Shift=T=25 to T=50, Training Strategy=Reward Mixture, Backbone=Gemma-2-9b-it2025.11 | 122.45 | 12.05 | 57 | |
| GPT-4o miniHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 70.82 | 22.28 | 74 | |
| FTRLHorizon Shift=T=25 to T=50, Training Strategy=N/A2025.11 | 55.04 | 38.9 | 75 | |
| Trained GPT-4o miniHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 39.65 | 17.09 | 65 | |
| FTRLHorizon (T)=25, Actions (d)=3, Generalization protocol=Horizon Generalization [T=15 -> T=25], Training distribution=mixture of Gaussian, Uniform, and Sine-trend2025.11 | 39.15 | 24.16 | 75 |