Inverse Reinforcement Learning on MuJoCo Ant
1.03Normalized ReturnTRIRL
Evaluation Results
| Method | Links | |
|---|---|---|
| TRIRLOptimization Objective=TR loss2026.05 | 1.03 | |
| TRIRLOptimization Objective=max η2026.05 | 1 | |
| ConTraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.93 | |
| SFMContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.88 | |
| C-AIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.82 | |
| TraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.57 | |
| SFMDynamics Model=forward dynamics model (FDM), Policy Architecture=TD72026.05 | 0.36 |