Offline Reinforcement Learning on D4RL Antmaze umaze
100Normalized ScoreFQL
Evaluation Results
| Method | Links | |
|---|---|---|
| FQL2025.10 | 100 | |
| GTP2025.10 | 100 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 99.4 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 98.5 | |
| TD3+BCDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 98.5 | |
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 98.3 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 97.8 | |
| QIPO-Diff2025.10 | 97.5 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 97.1 | |
| SAC-RNDPolicy Type=Gaussian, Seeds=82026.02 | 97 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 96 | |
| CQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 94.8 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 94 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 93.6 | |
| QIPO-OT2025.10 | 93.6 | |
| XQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 90.3 | |
| QQLDomain=AntMaze, Hyperparameter Tuning=consistent2025.11 | 88.5 | |
| MXQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 88.3 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 87.5 | |
| IQLDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 84 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 78.6 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 75.8 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 74 | |
| BCDomain=AntMaze, Hyperparameter Tuning=individually tuned2025.11 | 68.5 |