Offline Reinforcement Learning (Robotic Manipulation) on D4RL Adroit (pen tasks)
82Score (pen-human-v1)BFQ
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BFQPolicy Category=One-Step Diffusion/Flow Policy, Steps=12026.06 | 82 | 75 | 79 | |
| FBRACPolicy Category=Flow Policies, Steps=102026.06 | 77 | 67 | 72 | |
| IDQLPolicy Category=Diffusion Policies, Steps=52026.06 | 76 | 64 | 70 | |
| IQLPolicy Category=Gaussian Policies, Steps=12026.06 | 75 | 73 | 74 | |
| BCPolicy Category=Gaussian Policies, Steps=12026.06 | 72 | 51 | 62 | |
| IFQLPolicy Category=Flow Policies, Steps=102026.06 | 71 | 80 | 76 | |
| SORLPolicy Category=Flow Policies, Steps=82026.06 | 70 | 75 | 73 | |
| SRPOPolicy Category=One-Step Diffusion/Flow Policy, Steps=12026.06 | 69 | 61 | 65 | |
| FAWACPolicy Category=Diffusion Policies, Steps=102026.06 | 67 | 62 | 65 | |
| SORLPolicy Category=One-Step Diffusion/Flow Policy, Steps=12026.06 | 64.5 | 74.2 | 69 | |
| CACPolicy Category=Diffusion Policies, Steps=22026.06 | 64 | 56 | 60 | |
| FQLPolicy Category=One-Step Diffusion/Flow Policy, Steps=12026.06 | 53 | 74 | 64 |