Inverse Reinforcement Learning on MuJoCo Swimmer target contexts
97Normalized ReturnConTraIRL
Evaluation Results
| Method | Links | |
|---|---|---|
| ConTraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 97 | |
| SFMContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 90 | |
| C-AIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 84 | |
| TraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 50 |