Off-policy learning on Simulation Blocks 2-5 Cross-block averages
0.7216Average ValueMa-style OPL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Ma-style OPL2026.04 | 0.7216 | 0.1079 | 38.73 | |
| DR value only2026.04 | 0.7176 | 0.1119 | 31.27 | |
| DR-LCBparameter=0.502026.04 | 0.7175 | 0.112 | 31.01 | |
| CASPparameter=0.052026.04 | 0.7147 | 0.1148 | 26.77 | |
| Plug-in2026.04 | 0.7122 | 0.1173 | 44.98 | |
| Wang-style generator2026.04 | 0.696 | 0.1335 | 43.5 | |
| Stagewise2026.04 | 0.6771 | 0.1524 | 38.9 |