Offline Meta-Reinforcement Learning on Walker-Rand-Params sampled 10 unseen (test)
344.2Average ReturnCSRO
Evaluation Results
| Method | Links | |
|---|---|---|
| CSROnon-prior context collection strategy (Np)=true, offline RL algorithm=BRAC2023.11 | 344.2 | |
| CSROnon-prior context collection strategy (Np)=false, offline RL algorithm=BRAC2023.11 | 319.7 | |
| CORROnon-prior context collection strategy (Np)=true, offline RL algorithm=BRAC2023.11 | 312.5 | |
| OffPearlnon-prior context collection strategy (Np)=true, offline RL algorithm=BRAC2023.11 | 284.5 | |
| CORROnon-prior context collection strategy (Np)=false, offline RL algorithm=BRAC2023.11 | 275.2 | |
| OffPearlnon-prior context collection strategy (Np)=false, offline RL algorithm=BRAC2023.11 | 262 | |
| BORELnon-prior context collection strategy (Np)=true, offline RL algorithm=BRAC2023.11 | 260.6 | |
| FOCALnon-prior context collection strategy (Np)=true, offline RL algorithm=BRAC2023.11 | 253.3 | |
| FOCALnon-prior context collection strategy (Np)=false, offline RL algorithm=BRAC2023.11 | 247.5 | |
| BORELnon-prior context collection strategy (Np)=false, offline RL algorithm=BRAC2023.11 | 245.8 |