Robotic Manipulation on Simpler WidowX Simulation
82Success Rate: Spoon on TowelQwen3VL-SFT-VLA
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3VL-SFT-VLA2026.05 | 82 | 44 | 40 | 80 | 61.5 | |
| GEM-VLAtraining=fine-tuned on BridgeDataV2, steps=50k2026.05 | 82 | 58 | 44 | 84 | 67 | |
| AnchorVLA4D⋆Method Type=Ours, Model Size=4.4B, Sampling timesteps=102026.03 | 79.2 | 37.5 | 50 | 91.7 | 64.6 | |
| Vlaser2026.05 | 76.6 | 52.5 | 43.3 | 87.9 | 65.1 | |
| MemoryVLAMethod Type=Temporal, Model Size=7B + 300M2026.03 | 75 | 75 | 37.5 | 100 | 71.9 | |
| finetuned VanillaVLAMethod Type=Ours, Model Size=3B + 400M, Sampling timesteps=50, Evaluation Protocol=finetuned2026.03 | 75 | 37.5 | 62.5 | 70.8 | 61.5 | |
| CogACT-BaseMethod Type=Standard, Model Size=7B + 300M2026.03 | 71.7 | 50.8 | 15 | 67.5 | 51.3 | |
| π0-Uniform⋆Method Type=Standard, Model Size=3B + 300M2026.03 | 63.3 | 58.8 | 21.3 | 79.2 | 55.7 | |
| pi02026.05 | 63.3 | 55.8 | 21.3 | 79.2 | 54.9 | |
| SoFarMethod Type=Spatial, Model Size=3.5B2026.03 | 58.3 | 66.7 | 70.8 | 37.5 | 58.3 | |
| ThinkAct2026.05 | 58.3 | 37.5 | 8.7 | 70.8 | 43.8 | |
| VanillaVLAMethod Type=Ours, Model Size=3B + 400M, Sampling timesteps=502026.03 | 54.2 | 37.5 | 33.3 | 79.2 | 51 | |
| FSDMethod Type=Spatial, Model Size=13B2026.03 | 41.7 | 50 | 33.3 | 37.5 | 40.6 | |
| ST-VLAMethod Type=Temporal, Model Size=-2026.03 | 36.4 | 25 | 36.4 | 54.5 | 38.1 | |
| RoboVLM2026.05 | 29.2 | 25 | 12.5 | 58.3 | 31.3 | |
| SpatialVLAMethod Type=Spatial, Model Size=3.5B2026.03 | 16.7 | 25 | 29.2 | 100 | 42.7 | |
| SpatialVLA2026.05 | 16.7 | 25 | 62.5 | 100 | 42.7 | |
| TraceVLAMethod Type=Temporal, Model Size=7B2026.03 | 12.5 | 16.6 | 16.6 | 65 | 27.7 | |
| Octo-Base2026.05 | 12.5 | 8.3 | 31.9 | 43.1 | 16 | |
| TraceVLA2026.05 | 12.5 | 16.6 | 16.6 | 65 | 27.7 | |
| OpenVLAMethod Type=Standard, Model Size=7B2026.03 | 4.2 | 0 | 0 | 12.5 | 4.2 | |
| Diffusion Policy2026.05 | 4.2 | 0 | 0 | 0 | 1.1 | |
| OpenVLA2026.05 | 0 | 0 | 0 | 4.1 | 1 |