Horizon Generalization on FOL Gaussian reward
137.19Max LRGemma-2-9b-it
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Gemma-2-9b-itHorizon Shift=T=25 to T=50, Backbone=Gemma-2-9b-it2025.11 | 137.19 | 20.62 | 0.87 | |
| Trained Gemma-2-9b-itHorizon Shift=T=25 to T=50, Training Strategy=Reward Mixture, Backbone=Gemma-2-9b-it2025.11 | 93.08 | 20.45 | 0.8 | |
| FTRLHorizon Shift=T=25 to T=50, Training Strategy=N/A2025.11 | 49.7 | 27.99 | 0.81 |