Reward Recovery on Synthetic environment (test)
0.37Mean Squared Error (MSE)GenPQR
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GenPQRNormalization=BC, FQE Type=NN (neural FQE)2025.09 | 0.37 | 0.81 | 1.546 | |
| GenPQRNormalization=AIRL, FQE Type=NN (neural FQE)2025.09 | 0.63 | 0.72 | 1.608 | |
| DeepPQR2025.09 | 0.79 | 0.69 | 1.608 | |
| GenPQRNormalization=BC, FQE Type=GBT (boosted FQE)2025.09 | 1.07 | 0.49 | 1.546 | |
| GenPQRNormalization=AIRL, FQE Type=GBT (boosted FQE)2025.09 | 1.07 | 0.41 | 1.608 | |
| MaxEnt-IRL2025.09 | 1.17 | 0.35 | 1.624 | |
| AIRL state reward2025.09 | 2.17 | -0.01 | 1.608 | |
| Log-policy pseudo2025.09 | 3.4 | 0.37 | 1.608 |