Reinforcement Learning on Ant v5 (Mean Performance and Step Metrics)
5,608.2Mean Episode ReturnTFM-S3-TD3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TFM-S3-TD3Algorithm=TFM-S3-TD3, Variant=proposed2026.04 | 5,608.2 | 6.1 | 63 | |
| TFM-S3-TD3Algorithm=TFM-S3-TD3, Variant=One shot2026.04 | 5,419.8 | 8.4 | 70.1 | |
| Random Search TD3Algorithm=Random Search, Candidates=322026.04 | 5,386.9 | 20.8 | 69.2 | |
| TD3Algorithm=TD3, Variant=vanilla2026.04 | 5,279.6 | 22.5 | 71.6 |