Offline Reinforcement Learning on D4RL MuJoCo halfcheetah-medium-expert
104.5Normalized ScoreROMI
Evaluation Results
| Method | Links | |
|---|---|---|
| ROMItraining steps=1M, seeds=5, version=v22026.03 | 104.5 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 101.9 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 101.1 | |
| COUNTtraining steps=1M, seeds=5, version=v22026.03 | 100 | |
| FQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 99.8 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 99.6 | |
| BFQPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 98.6 | |
| SPAR-PROJLearning Paradigm=Ours2026.05 | 97 | |
| Diff-QLLearning Paradigm=Policy Gradient Guidance2026.05 | 96.8 | |
| SORLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 96.5 | |
| MOBILEtraining steps=1M, seeds=5, version=v22026.03 | 96.1 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 95.9 | |
| EDPPolicy Type=Diffusion Policy2026.06 | 95.8 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 95.7 | |
| ISEP-FMFlow Matching=true2026.05 | 95.7 | |
| DQLPolicy Type=Diffusion Policy2026.06 | 95.5 | |
| OFQLPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 95.2 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 94.5 | |
| DQL2026.05 | 94.4 | |
| QIPO2026.05 | 94.4 | |
| IDQLLearning Paradigm=In-Support Learning2026.05 | 94.4 | |
| PLASLearning Paradigm=Policy Gradient Guidance2026.05 | 94.3 | |
| LAPOLearning Paradigm=In-Support Learning2026.05 | 94.2 | |
| RAMBOtraining steps=1M, seeds=5, version=v22026.03 | 93.9 | |
| QGPO2026.05 | 93.5 | |
| ISEPFlow Matching=false2026.05 | 92.4 | |
| MOPOtraining steps=1M, seeds=5, version=v22026.03 | 92.3 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 92.2 | |
| SRPOPolicy Type=One-Step Flow/Diffusion Policy2026.06 | 92.2 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 91.6 | |
| CQLLearning Paradigm=Policy Gradient Guidance2026.05 | 91.6 | |
| TD3-BCPolicy Type=Gaussian Policy2026.06 | 91.5 | |
| IDQLPolicy Type=Diffusion Policy2026.06 | 91.3 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 90.7 | |
| TD3+BCLearning Paradigm=Policy Gradient Guidance2026.05 | 90.7 | |
| EQLLearning Paradigm=In-Support Learning2026.05 | 90.6 | |
| IDQL2026.05 | 90.3 | |
| BCQLearning Paradigm=Policy Gradient Guidance2026.05 | 89.1 | |
| IQLPolicy Type=Gaussian Policy2026.06 | 88.3 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 87.5 | |
| SPOTPolicy Type=Gaussian, Seeds=82026.02 | 86.9 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 86.7 | |
| IQL2026.05 | 86.7 | |
| IQLLearning Paradigm=In-Support Learning2026.05 | 86.7 | |
| IQLtraining steps=1M, seeds=5, version=v22026.03 | 86.3 | |
| SPAR-MLPLearning Paradigm=Ours2026.05 | 85.2 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 84.3 | |
| CQL-AWLearning Paradigm=In-Support Learning2026.05 | 84 | |
| CQLtraining steps=1M, seeds=5, version=v22026.03 | 75.6 | |
| BaseLearning Paradigm=Ours2026.05 | 63.1 | |
| CQL2026.05 | 62.4 | |
| BCPolicy Type=Gaussian Policy2026.06 | 60.2 | |
| BC2026.05 | 55.2 | |
| AWACLearning Paradigm=In-Support Learning2026.05 | 42.8 |