Offline Reinforcement Learning on D4RL antmaze-umaze (diverse)
93.5Normalized ScoreFAC
Evaluation Results
| Method | Links | |
|---|---|---|
| FACPolicy Type=Flow, Seeds=82026.02 | 93.5 | |
| Decision Mamba2024.06 | 90 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 89 | |
| GCIQL2023.07 | 88.8 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 88.3 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 84 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 82.1 | |
| GTP2025.10 | 81.9 | |
| QQLDomain=AntMaze, Hyperparameter Tuning=consistent2025.11 | 81.3 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 80.2 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 80 | |
| IQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 79.5 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 78.3 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 77.6 | |
| XQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 77.2 | |
| SPAR-PROJLearning Paradigm=Ours2026.05 | 76.7 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 76.1 | |
| QIPO-OT2025.10 | 76.1 | |
| DWSL2023.07 | 74.6 | |
| QIPO-Diff2025.10 | 73.9 | |
| TD3+BCEvaluations=final 10, Seeds=5, State feature normalization=false2021.06 | 71.4 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 71.4 | |
| TD3+BCDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 71.3 | |
| IQL2023.07 | 71.2 | |
| GCPC2023.07 | 71.2 | |
| LaMo2024.06 | 70 | |
| RvS-G2023.07 | 66.2 | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | 66 | |
| BCDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 64.8 | |
| ROMI-CQL2021.10 | 63.6 | |
| BC2023.07 | 63.4 | |
| SPAR-MLPLearning Paradigm=Ours2026.05 | 63.3 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 62.2 | |
| PLASLearning Paradigm=Policy Gradient Guidance2026.05 | 62 | |
| IDQLLearning Paradigm=In-Support Learning2026.05 | 62 | |
| ROMI-BCQ2021.10 | 61.2 | |
| BC2024.06 | 61 | |
| DT2024.06 | 61 | |
| COMBO2021.10 | 57.3 | |
| Diff-QLLearning Paradigm=Policy Gradient Guidance2026.05 | 57.3 | |
| WGCSL2023.07 | 55.6 | |
| CQL-AWLearning Paradigm=In-Support Learning2026.05 | 54 | |
| CQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 53.8 | |
| DT2023.07 | 53.4 | |
| MXQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 53.2 | |
| BAIL2021.10 | 52 | |
| EQLLearning Paradigm=In-Support Learning2026.05 | 50.8 | |
| BiTrajDiffAlgorithm=CQL, Augmentation Method=Ours2025.06 | 48.8 | |
| BCQ2021.10 | 48 | |
| BiTrajDiffAlgorithm=DT, Augmentation Method=Ours2025.06 | 47.8 | |
| CQL2023.07 | 47.4 | |
| BC2021.10 | 47 | |
| RTDiffAlgorithm=DT, Augmentation Method=RTDiff2025.06 | 46.4 | |
| SyntherAlgorithm=DT, Augmentation Method=Synther2025.06 | 44.8 | |
| DiffStitchAlgorithm=DT, Augmentation Method=DiffStitch2025.06 | 42.6 | |
| SyntherAlgorithm=CQL, Augmentation Method=Synther2025.06 | 42.4 | |
| BaseAlgorithm=DT, Augmentation Method=Base2025.06 | 42 | |
| RTDiffAlgorithm=CQL, Augmentation Method=RTDiff2025.06 | 40.6 | |
| BaseLearning Paradigm=Ours2026.05 | 40 | |
| DiffStitchAlgorithm=CQL, Augmentation Method=DiffStitch2025.06 | 39.2 | |
| CQLLearning Paradigm=Policy Gradient Guidance2026.05 | 39.2 | |
| BEAR2021.10 | 37.7 | |
| IQLLearning Paradigm=In-Support Learning2026.05 | 37.3 | |
| BaseAlgorithm=CQL, Augmentation Method=Base2025.06 | 31.6 | |
| BCQLearning Paradigm=Policy Gradient Guidance2026.05 | 28 | |
| LAPOLearning Paradigm=In-Support Learning2026.05 | 28 | |
| CQL2021.10 | 6.3 | |
| TD3+BCLearning Paradigm=Policy Gradient Guidance2026.05 | 1.7 | |
| BRAC-P2021.10 | 0 | |
| BRAC-v2021.10 | 0 | |
| MOPO2021.10 | 0 | |
| MOREL2021.10 | 0 | |
| Repb-SDE2021.10 | 0 | |
| AWACLearning Paradigm=In-Support Learning2026.05 | -0.8 |