Robot Manipulation on Meta-world v1 v2 (train test)
94.4BasketballTemporalOT
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| TemporalOTReward Source=Optimal Transport with context matrix and temporal mask2024.10 | 94.4 | 92.4 | 33.4 | 78.4 | 3,680 | 53.6 | 840 | 97.6 | 55.2 | 61.1 | |
| OT0.9Reward Source=Optimal Transport, Discount factor (gamma)=0.92024.10 | 76.6 | 85.2 | 2.8 | 30.2 | 1,120 | 35.6 | 700 | 48.8 | 22.4 | 35.5 | |
| ADSReward Source=Optimal Transport, Discount factor (gamma)=Adaptive (progress tracker)2024.10 | 42.2 | 89 | 3.2 | 52 | 3,500 | 21.2 | 1,720 | 20 | 43.6 | 35.9 | |
| BCReward Source=Expert actions (Behavior Cloning)2024.10 | 0.2 | 1.7 | 4.6 | 10.7 | 230 | 0.8 | 40 | 0 | 1.6 | 2.5 | |
| TaskRewardReward Source=Oracle task reward, Backbone RL agent=DrQ-v22024.10 | 0 | 14 | 86.2 | 0 | 80 | 0 | 100 | 0 | 85.6 | 20.8 | |
| GAIfOReward Source=Learned discriminator (IL)2024.10 | 0 | 1 | 8.8 | 2.2 | 860 | 3.4 | 0 | 18.8 | 4 | 5.2 | |
| OT0.99Reward Source=Optimal Transport, Discount factor (gamma)=0.992024.10 | 0 | 88.8 | 3 | 46.2 | 2,900 | 15.4 | 1,420 | 0 | 54 | 27.8 |