Robotic Manipulation on SIMPLER Visual Matching WidowX Robot
95.8Put Spoon on Towel ScoreLoLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| LoLA2025.12 | 95.8 | 58.3 | 54.2 | 79.2 | 71.9 | |
| LatBot2025.11 | 95.8 | 87.5 | 83.3 | 83.3 | 87.5 | |
| StarVLA-OFTSteps=65K, Vision-Language (VL) Backbone=Qwen3-VL-4B2026.04 | 90.3 | 38.5 | 29.7 | 100 | 64.6 | |
| DAM-VLA2026.03 | 88 | 71 | 25 | 100 | 71 | |
| StarVLA-GR00TSteps=20K, Vision-Language (VL) Backbone=Qwen3-VL-4B2026.04 | 83 | 59.4 | 18.8 | 100 | 65.3 | |
| StarVLA-πSteps=30K, Vision-Language (VL) Backbone=Cosmos-Predict2-2B2026.04 | 81.4 | 55.2 | 25.1 | 73 | 58.7 | |
| StarVLA-GR00TSteps=30K, Vision-Language (VL) Backbone=Cosmos-Predict2-2B2026.04 | 80.4 | 65.4 | 20 | 80.6 | 61.6 | |
| π0.52025.11 | 79.2 | 58.3 | 16.7 | 66.7 | 55.2 | |
| StarVLA-πSteps=40K, Vision-Language (VL) Backbone=Qwen3-VL-4B2026.04 | 78.1 | 46.9 | 30.2 | 88.5 | 60.9 | |
| GR00T N1.5Steps=-2026.04 | 75.3 | 54.3 | 57 | 61.3 | 61.9 | |
| VideoVLA2025.12 | 75 | 20.8 | 45.8 | 70.8 | 53.1 | |
| MemoryVLA2025.11 | 75 | 75 | 37.5 | 100 | 71.9 | |
| CogACT2025.12 | 71.7 | 50.8 | 15 | 67.5 | 51.3 | |
| CogACT2025.12 | 71.7 | 50.8 | 15 | 67.5 | 51.3 | |
| CogACT2025.11 | 71.7 | 50.8 | 15 | 67.5 | 51.3 | |
| CogACTSteps=-2026.04 | 71.7 | 50.8 | 15 | 67.5 | 51.3 | |
| StarVLA-OFTSteps=30K, Vision-Language (VL) Backbone=Cosmos-Predict2-2B2026.04 | 66.8 | 62.6 | 25.3 | 90.2 | 61.2 | |
| CogACT2026.03 | 63 | 50 | 25 | 71 | 52 | |
| π02025.12 | 62.5 | 66.7 | 25 | 12.5 | 41.7 | |
| π02025.11 | 62.5 | 66.7 | 25 | 12.5 | 41.7 | |
| π0*training_dataset=BridgeDataV22026.03 | 62 | 59 | 24 | 81 | 57 | |
| UniVLA2025.11 | 52.8 | 55.6 | 2.8 | 80.6 | 47.9 | |
| villa-X2025.11 | 48.3 | 24.2 | 19.2 | 71.7 | 40.8 | |
| Octo-Small2026.03 | 47 | 8 | 1 | 51 | 27 | |
| OctoVariant=Small2025.12 | 41.7 | 8.2 | 0 | 56.7 | 26.7 | |
| Octo-Small2025.12 | 41.7 | 8.2 | 0 | 56.7 | 26.7 | |
| Octo-SmallSteps=-2026.04 | 41.7 | 8.2 | 0 | 56.7 | 26.7 | |
| MagmaSteps=-2026.04 | 37.5 | 31 | 12.7 | 60.5 | 35.8 | |
| π0Input=visual observations only2025.12 | 29.2 | 62.5 | 29.2 | 91.6 | 53.1 | |
| π0Steps=-2026.04 | 29.1 | 0 | 16.6 | 62.5 | 27.1 | |
| π0-FASTSteps=-2026.04 | 29.1 | 21.9 | 10.8 | 66.6 | 48.3 | |
| RoboVLM2026.03 | 29 | 25 | 13 | 58 | 31 | |
| SpatialVLA2025.12 | 20.8 | 20.8 | 25 | 70.8 | 34.4 | |
| StarVLA-FASTSteps=15K, Vision-Language (VL) Backbone=Qwen3-VL-4B2026.04 | 18.8 | 31.3 | 4.2 | 71.9 | 31.6 | |
| SpatialVLA2026.03 | 17 | 25 | 29 | 100 | 43 | |
| SpatialVLA2025.12 | 16.7 | 25 | 29.2 | 100 | 42.7 | |
| SpatialVLA2025.11 | 16.7 | 25 | 29.2 | 100 | 42.7 | |
| SpatialVLASteps=-2026.04 | 16.7 | 25 | 29.2 | 100 | 42.7 | |
| OctoVariant=Base2025.12 | 15.8 | 12.5 | 0 | 41.7 | 17.5 | |
| Octo-Base2025.12 | 15.8 | 12.5 | 0 | 41.7 | 17.5 | |
| Octo-BaseSteps=-2026.04 | 15.8 | 12.5 | 0 | 41.7 | 17.5 | |
| Octo-Base2026.03 | 7 | 13 | 0 | 44 | 16 | |
| OpenVLA2025.12 | 4.2 | 0 | 0 | 12.5 | 4.2 | |
| OpenVLA2025.12 | 4.2 | 0 | 0 | 12.5 | 4.2 | |
| OpenVLASteps=-2026.04 | 4.2 | 0 | 0 | 12.5 | 4.2 | |
| RT-1-X2026.03 | 4 | 8 | 0 | 0 | 3 | |
| OpenVLA2026.03 | 4 | 0 | 0 | 4 | 2 | |
| ECOT2026.03 | 4 | 8 | 0 | 0 | 3 | |
| RT-1-X2025.12 | 0 | 4.2 | 0 | 0 | 1.1 | |
| RT-1-X2025.12 | 0 | 4.2 | 0 | 0 | 1.1 | |
| RT-1-XSteps=-2026.04 | 0 | 4.2 | 0 | 0 | 1.1 |