Multi-Task Reinforcement Learning on Meta-World MT50 V1 (final-checkpoint)
79.3Success Rate (IQM)TOPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| TOPPOParams=717K, Backbone=[400]×32026.05 | 79.3 | |
| MT-PPO + LN-c + PopArt + FG-cParams=717K, Backbone=[400]×32026.05 | 79 | |
| MT-PPO + LN-c + PopArtParams=717K, Backbone=[400]×32026.05 | 76.5 | |
| MT-PPO + LN-cParams=717K, Backbone=[400]×32026.05 | 64.3 | |
| MT-PPO + LN-c + FG-cParams=717K, Backbone=[400]×32026.05 | 62 | |
| MOOREParams=10385K, TOPPO step to match=∼13M (13%), Backbone=[400]×3, 6 experts2026.05 | 61.8 | |
| Soft ModularizationParams=8030K, TOPPO step to match=∼12M (12%), Backbone=routing [256]×4×42026.05 | 60.6 | |
| PCGrad-SACParams=2031K, TOPPO step to match=∼5.5M (5%), Backbone=[400]×3 shared, per-task heads2026.05 | 45.8 | |
| Vanilla MT-PPOParams=716K, Backbone=[400]×32026.05 | 45.2 | |
| MT-MH-SACParams=2031K, TOPPO step to match=∼3.4M (3%), Backbone=[400]×3 shared, per-task heads2026.05 | 31.9 | |
| PaCoParams=33909K, TOPPO step to match=∼2.1M (2%), Backbone=[400]×3, K=202026.05 | 18.6 |