Inverse Reinforcement Learning on MuJoCo Walker
73Normalized ReturnTRIRL
Evaluation Results
| Method | Links | |
|---|---|---|
| TRIRLOptimization Objective=max η2026.05 | 73 | |
| TRIRLOptimization Objective=TR loss2026.05 | 72 | |
| SFMDynamics Model=forward dynamics model (FDM), Policy Architecture=TD72026.05 | 51 | |
| ConTraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.96 | |
| SFMContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.89 | |
| C-AIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.86 | |
| TraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.51 |