Offline Reinforcement Learning on OGBench offline 1M
87AntMaze Large Navigate Score (Single Task)FAV
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| FAVPolicy Category=Ours2026.05 | 87 | 26 | 64 | 5 | 59 | 93 | 26 | 55 | 73 | 16 | 54 | |
| ReBRACPolicy Category=Gaussian Policies2026.05 | 81 | 26 | 22 | 2 | 0 | 91 | 12 | 41 | 21 | 14 | 36 | |
| FAV-AdaptivePolicy Category=Ours2026.05 | 80 | 26 | 44 | 4 | 60 | 92 | 24 | 55 | 63 | 12 | 50 | |
| FQLPolicy Category=Distillation Policies2026.05 | 79 | 9 | 58 | 4 | 60 | 96 | 29 | 56 | 30 | 17 | 48 | |
| QAMPolicy Category=Flow-based Policies2026.05 | 77 | 3 | 63 | 4 | 61 | 57 | 30 | 59 | 19 | 38 | 45 | |
| IQLPolicy Category=Gaussian Policies2026.05 | 53 | 4 | 33 | 2 | 8 | 83 | 7 | 28 | 9 | 7 | 27 | |
| DSRLPolicy Category=Latent Opt.2026.05 | 40 | 0 | 34 | 10 | 28 | 93 | 53 | 88 | 0 | 37 | 40 | |
| CACPolicy Category=Distillation Policies2026.05 | 33 | 0 | 53 | 0 | 2 | 85 | 6 | 40 | 19 | 15 | 26 | |
| IFQLPolicy Category=Flow-based Policies2026.05 | 28 | 3 | 60 | 11 | 33 | 79 | 14 | 30 | 19 | 25 | 34 | |
| SRPOPolicy Category=Distillation Policies2026.05 | 11 | 0 | 1 | 0 | 1 | 80 | 2 | 20 | 18 | 10 | 20 | |
| FAWACPolicy Category=Flow-based Policies2026.05 | 6 | 0 | 19 | 0 | 12 | 81 | 5 | 30 | 6 | 1 | 19 |