Offline Reinforcement Learning on OGBench State-based Singletask Offline v0
97Success RateValue Flows
Evaluation Results
| Method | Links | |
|---|---|---|
| Value FlowsPolicy Architecture=Flow Policies, Hyperparameter Tuning=False2025.10 | 97 | |
| CODACPolicy Architecture=Flow Policies, Hyperparameter Tuning=False2025.10 | 80 | |
| IQNPolicy Architecture=Flow Policies, Hyperparameter Tuning=False2025.10 | 70 | |
| FQLPolicy Architecture=Flow Policies, Hyperparameter Tuning=False2025.10 | 61 | |
| FBRACPolicy Architecture=Gaussian Policies, Hyperparameter Tuning=False2025.10 | 47 | |
| ReBRACPolicy Architecture=Gaussian Policies, Hyperparameter Tuning=False2025.10 | 45 | |
| IFQLPolicy Architecture=Gaussian Policies, Hyperparameter Tuning=False2025.10 | 35 | |
| IQLPolicy Architecture=Gaussian Policies, Hyperparameter Tuning=False2025.10 | 27 | |
| C51Policy Architecture=Flow Policies, Hyperparameter Tuning=False2025.10 | 9 | |
| BCPolicy Architecture=Gaussian Policies, Hyperparameter Tuning=False2025.10 | 8 |