Offline Reinforcement Learning on D4RL (Held-out Evaluator)
2.97Temporal ErrorPoE (Refinement Prior)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| PoE (Refinement Prior)Prior=Refinement2026.04 | 2.97 | 3.01 | 3 | 2.96 | 2.96 | 10.78 | |
| PoE (Critic Prior)Prior=Critic2026.04 | 3 | 3.02 | 3.01 | 3.02 | 3 | 12 | |
| Pretrained Actor2026.04 | 3.07 | 3.06 | 3.06 | 3.05 | 3.05 | 7.43 | |
| CQL2026.04 | 3.25 | 3.21 | 3.21 | 3.21 | 3.21 | 0 | |
| IQL2026.04 | 3.25 | 3.21 | 3.21 | 3.21 | 3.21 | 0 | |
| Critic-Greedy2026.04 | 5.41 | 5.41 | 5.41 | 5.41 | 5.41 | 0 |