Multi-objective Reinforcement Learning on MO-Gymnasium 8 discrete-action tasks
4.25Hypervolume (HV)LS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LSTraining Steps=2M, Seeds=8, Codebase=PreCo, Reporting Format=Average Rank2026.05 | 4.25 | 3.88 | 4.75 | |
| CAPQLTraining Steps=2M, Seeds=8, Codebase=PreCo, Reporting Format=Average Rank2026.05 | 4.12 | 3.5 | 3.25 | |
| C-MORLTraining Steps=2M, Seeds=8, Reporting Format=Average Rank, Note=Pareto-front discovery baseline2026.05 | 4.12 | 3.62 | 2.38 | |
| PreCoTraining Steps=2M, Seeds=8, Reporting Format=Average Rank2026.05 | 3.75 | 3.38 | 4.75 | |
| PCSACTraining Steps=2M, Seeds=8, Codebase=PreCo, Reporting Format=Average Rank2026.05 | 3 | 3.5 | 2.62 | |
| CMDPITraining Steps=2M, Seeds=8, Codebase=PreCo, Reporting Format=Average Rank2026.05 | 1.75 | 3.12 | 3.25 |