Robot Manipulation Success Rates on SimplerEnv-WidowX
29.2Stacking Success RateRandom (within-bucket)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Random (within-bucket)VLA Model Architecture=Qwen3-VL-4B-GR00T, Ablation=Learning-Friendly Trajectory Selection, Training Data Budget=50%, Training Steps=25K2026.07 | 29.2 | 36.5 | 77.1 | 71.9 | 53.7 | |
| SIEVEVLA Model Architecture=Qwen3-VL-4B-GR00T, Training Data Budget=50%, Training Steps=25K2026.07 | 25 | 54.2 | 70.8 | 75 | 56.3 | |
| w/o Prim.VLA Model Architecture=Qwen3-VL-4B-GR00T, Ablation=Structural Exposure Allocation, Training Data Budget=50%, Training Steps=25K2026.07 | 25 | 51 | 68.8 | 61.5 | 51.6 | |
| Full-TrainingVLA Model Architecture=Qwen3-VL-4B-GR00T, Training Data Budget=100%, Training Steps=50K2026.07 | 22.9 | 53.1 | 68.8 | 62.5 | 51.8 | |
| w/o Trans.VLA Model Architecture=Qwen3-VL-4B-GR00T, Ablation=Structural Exposure Allocation, Training Data Budget=50%, Training Steps=25K2026.07 | 22.9 | 47.9 | 67.7 | 64.6 | 50.8 | |
| Full-TrainingVLA Model Architecture=Qwen3-VL-4B-OFT, Training Data Budget=100%, Training Steps=50K2026.07 | 21.9 | 25 | 45.8 | 62.5 | 38.8 | |
| SIEVEVLA Model Architecture=Qwen3-VL-4B-OFT, Training Data Budget=50%, Training Steps=25K2026.07 | 21.9 | 58.3 | 50 | 95.8 | 56.5 | |
| RandomVLA Model Architecture=Qwen3-VL-4B-GR00T, Training Data Budget=50%, Training Steps=25K2026.07 | 20.8 | 41.7 | 64.6 | 31.3 | 39.6 | |
| Most-DissimVLA Model Architecture=Qwen3-VL-4B-GR00T, Ablation=Learning-Friendly Trajectory Selection, Training Data Budget=50%, Training Steps=25K2026.07 | 18.8 | 45.8 | 64.6 | 31.3 | 40.1 | |
| RandomVLA Model Architecture=Qwen3-VL-4B-OFT, Training Data Budget=50%, Training Steps=25K2026.07 | 9.4 | 33.3 | 16.6 | 45.8 | 26.3 |