Robot Manipulation on LIBERO few-shot
99.6Spatial Success RateπRL (Flow-SDE + PPO)
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| πRL (Flow-SDE + PPO)Training Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π0.52026.03 | 99.6 | 100 | 98.8 | 93 | 97.9 | 20.8 | |
| π0.5Training Protocol=Full SFT2026.03 | 98.8 | 98.2 | 98 | 92.4 | 96.9 | — | |
| πRL (Flow-SDE + PPO)Training Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π02026.03 | 98.4 | 99.4 | 96.2 | 90.2 | 96 | 38.4 | |
| πRL (Flow-SDE + GRPO)Training Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π02026.03 | 97.8 | 97.8 | 83.2 | 81.4 | 90 | 32.4 | |
| π-StepNFTTraining Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π0.52026.03 | 97.8 | 100 | 98.2 | 79.8 | 94 | 16.9 | |
| πRL (Flow-SDE + GRPO)Training Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π0.52026.03 | 97.4 | 99.8 | 91.2 | 77.6 | 91.5 | 14.4 | |
| π0Training Protocol=Full SFT2026.03 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 | — | |
| πfastTraining Protocol=Full SFT2026.03 | 96.4 | 96.8 | 88.6 | 60.2 | 85.5 | — | |
| π-StepNFTTraining Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π02026.03 | 93.5 | 98 | 83.7 | 86.7 | 90.5 | 32.9 | |
| OpenVLA-OFTTraining Protocol=Full SFT2026.03 | 91.6 | 95.3 | 90.6 | 86.5 | 91 | — | |
| OpenVLATraining Protocol=Full SFT2026.03 | 84.7 | 88.4 | 79.2 | 53.7 | 76.5 | — | |
| SFTTraining Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π0.52026.03 | 84.6 | 95.4 | 84.6 | 43.9 | 77.1 | — | |
| OctoTraining Protocol=Full SFT2026.03 | 78.9 | 85.7 | 84.6 | 51.1 | 75.1 | — | |
| SFTTraining Protocol=Few-shot SFT + RL, Base Policy Checkpoint=π02026.03 | 65.3 | 64.4 | 49.8 | 51.2 | 57.6 | — |