Offline Meta Reinforcement Learning on Contextual-DMC walker-speed In-distribution
835.6Average ReturnSPC
Evaluation Results
| Method | Links | |
|---|---|---|
| SPCProtocol=Few-shot, Distribution=In-distribution2026.03 | 835.6 | |
| CSROProtocol=Few-shot, Distribution=In-distribution2026.03 | 771.2 | |
| FOCALProtocol=Few-shot, Distribution=In-distribution2026.03 | 768.9 | |
| UNICORN-SSProtocol=Few-shot, Distribution=In-distribution2026.03 | 730.7 | |
| UNICORN-SUPProtocol=Few-shot, Distribution=In-distribution2026.03 | 518.6 | |
| DORAProtocol=Few-shot, Distribution=In-distribution2026.03 | 390.9 |