Offline Reinforcement Learning on D4RL MuJoCo halfcheetah-medium-replay
0.62Normalized ScoreEPQ
Evaluation Results
| Method | Links | |
|---|---|---|
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 0.62 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 0.587 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 0.568 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 0.554 | |
| ISEP-FMFlow Matching=true2026.05 | 0.546 | |
| SPOTPolicy Type=Gaussian, Seeds=82026.02 | 0.522 | |
| BFQPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 0.521 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 0.514 | |
| SRPOPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 0.514 | |
| OFQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 0.512 | |
| FQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 0.511 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 0.51 | |
| SPAR-MLPLearning Paradigm=Ours2026.05 | 0.509 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 0.493 | |
| CQL-AWLearning Paradigm=In-Support Learning2026.05 | 0.49 | |
| SORLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 0.483 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 0.48 | |
| QIPO2026.05 | 0.48 | |
| DQLPolicy Type=Diffusion Policy2026.06 | 0.479 | |
| DQL2026.05 | 0.478 | |
| Diff-QLLearning Paradigm=Policy Gradient Guidance2026.05 | 0.478 | |
| QGPO2026.05 | 0.476 | |
| EQLLearning Paradigm=In-Support Learning2026.05 | 0.472 | |
| IDQLPolicy Type=Diffusion Policy2026.06 | 0.465 | |
| ISEPFlow Matching=false2026.05 | 0.463 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 0.459 | |
| PLASLearning Paradigm=Policy Gradient Guidance2026.05 | 0.457 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 0.455 | |
| CQL2026.05 | 0.455 | |
| CQLLearning Paradigm=Policy Gradient Guidance2026.05 | 0.455 | |
| IDQL2026.05 | 0.451 | |
| IDQLLearning Paradigm=In-Support Learning2026.05 | 0.451 | |
| EDPPolicy Type=Diffusion Policy2026.06 | 0.449 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 0.446 | |
| TD3+BCLearning Paradigm=Policy Gradient Guidance2026.05 | 0.446 | |
| IQL2026.05 | 0.445 | |
| TD3-BCPolicy Type=Gaussian Policy2026.06 | 0.445 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 0.442 | |
| IQLLearning Paradigm=In-Support Learning2026.05 | 0.442 | |
| SPAR-PROJLearning Paradigm=Ours2026.05 | 0.436 | |
| IQLPolicy Type=Gaussian Policy2026.06 | 0.429 | |
| LAPOLearning Paradigm=In-Support Learning2026.05 | 0.419 | |
| AWACLearning Paradigm=In-Support Learning2026.05 | 0.405 | |
| BaseLearning Paradigm=Ours2026.05 | 0.405 | |
| BCQLearning Paradigm=Policy Gradient Guidance2026.05 | 0.404 | |
| BC2026.05 | 0.366 | |
| BCPolicy Type=Gaussian Policy2026.06 | 0.347 |