Reinforcement Learning on HalfCheetah vel
-38.6Average Episode ReturnPrompt-DT
Evaluation Results
| Method | Links | |
|---|---|---|
| Prompt-DTTraining dataset=HalfCheetah-vel, Prompt length (K*)=52026.05 | -38.6 | |
| MACAWTraining dataset=HalfCheetah-vel2026.05 | -121.6 | |
| Q-ALIGN DTTraining dataset=HalfCheetah-medium-expert, Evaluation protocol=zero-shot transfer2026.05 | -142.3 | |
| Prompt-DTTraining dataset=HalfCheetah-vel, Prompt length (K*)=02026.05 | -188.4 | |
| PEARLTraining dataset=HalfCheetah-vel2026.05 | -273.6 | |
| RADTTraining dataset=HalfCheetah-medium-expert, Evaluation protocol=zero-shot transfer2026.05 | -754.7 | |
| DCTraining dataset=HalfCheetah-medium-expert, Evaluation protocol=zero-shot transfer2026.05 | -756.7 | |
| DTTraining dataset=HalfCheetah-medium-expert, Evaluation protocol=zero-shot transfer2026.05 | -764.6 | |
| QTTraining dataset=HalfCheetah-medium-expert, Evaluation protocol=zero-shot transfer2026.05 | -824.6 | |
| QCSTraining dataset=HalfCheetah-medium-expert, Evaluation protocol=zero-shot transfer2026.05 | -1,298.7 |