Inverse Reinforcement Learning on MuJoCo Half Cheetah
1.07Normalized ReturnSFM
Evaluation Results
| Method | Links | |
|---|---|---|
| SFMDynamics Model=forward dynamics model (FDM), Policy Architecture=TD72026.05 | 1.07 | |
| TRIRLOptimization Objective=max η2026.05 | 1.05 | |
| TRIRLOptimization Objective=TR loss2026.05 | 0.96 | |
| ConTraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.95 | |
| SFMContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.9 | |
| C-AIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.85 | |
| TraIRLContext=Target (compositional dynamics-goal variation), Expert data=Partial expert states (20% of trajectory), Aggregation=Averaged over multiple random seeds (mean ± std)2026.06 | 0.55 |