Adaptive Policy Retrieval on 186-chunk corpus 1.0 (200 held-out episodes)
92AccuracyDPO (TRANSITION)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DPO (TRANSITION)Formulation=Transition-level2026.04 | 92 | 0.12 | 10.6 | |
| CQL2026.04 | 92 | 1.06 | 20 | |
| BC (IMITATION)Mode=Imitation2026.04 | 92 | 1.06 | 20 | |
| IQL2026.04 | 62.5 | 0.01 | 3.4 | |
| FIXEDKk=52026.04 | 62 | 0.26 | 6 | |
| FIXEDKk=32026.04 | 54 | 0.22 | 4 | |
| HEURISTICthreshold=0.82026.04 | 51 | 0.22 | 3.4 |