Robot Manipulation on LIBERO simulation
98.6Average Success RateDiT4DiT
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DiT4DiTTraining Setup=from scratch2026.03 | 98.6 | 98.4 | 99.6 | 98.6 | 97.6 | — | |
| SFTTraining Protocol=Specialist2026.03 | 98.3 | — | — | — | — | — | |
| Ω-QVLABackbone=Pi 0.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 98 | 99 | 97 | 100 | 96 | — | |
| PTRTraining Protocol=Specialist2026.03 | 97.8 | — | — | — | — | — | |
| QuantVLABackbone=Pi 0.5, Precision=W4A8, Quantization Setting=w/o DiT attention2026.05 | 97.6 | 98.5 | 98 | 98 | 96 | — | |
| CogVLA2026.03 | 97.4 | 98.6 | 98.8 | 96.6 | 95.4 | — | |
| PTRTraining Protocol=Generalist2026.03 | 97.4 | — | — | — | — | — | |
| OpenVLA-OFTModel Grouping=Large, Size=7.7B, Memory Usage=15.4GB (11.00×)2025.06 | 97.1 | 97.6 | 98.4 | 97.9 | 94.5 | — | |
| OpenVLA-OFT2026.03 | 97.1 | 97.6 | 98.4 | 97.9 | 94.5 | — | |
| Full PrecisionBackbone=Pi 0.5, Precision=FP16, Quantization Setting=No quantization2026.05 | 97.1 | 99 | 97.5 | 98.5 | 93.5 | — | |
| π0.52026.03 | 96.9 | 98.8 | 98.2 | 98 | 92.4 | — | |
| SmoothQuantBackbone=Pi 0.5, Precision=W4A8, Quantization Setting=Full quantization2026.05 | 96.8 | 99 | 98 | 96 | 94 | — | |
| Qwen3DiTTraining Setup=from scratch2026.03 | 96.6 | 98 | 98.8 | 96 | 93.6 | — | |
| SFTTraining Protocol=Generalist2026.03 | 96.2 | — | — | — | — | — | |
| BitVLAModel Grouping=Small, Size=3.0B, Memory Usage=1.4GB (1.00×), Pre-training configuration=standard2025.06 | 96 | 96.6 | 99 | 95.4 | 92.8 | — | |
| UnifiedVLAModel Grouping=Large, Size=8.5B, Memory Usage=17.0GB (12.14×)2025.06 | 95.5 | 95.4 | 98.8 | 93.6 | 94 | — | |
| UniVLAModel Grouping=Large, Size=8.5B, Memory Usage=17.0GB (12.14×)2025.06 | 95.2 | 96.5 | 96.8 | 95.6 | 92 | — | |
| UniVLA2026.03 | 95.2 | 96.5 | 96.8 | 95.6 | 92 | — | |
| Real demosTraining condition=Real demos2026.05 | 95.2 | 97.9 | 96.3 | 96.5 | — | 90.1 | |
| DuQuantBackbone=Pi 0.5, Precision=W4A8, Quantization Setting=Full quantization2026.05 | 95 | 96 | 99 | 93 | 92 | — | |
| QuantVLABackbone=Pi 0.5, Precision=W4A4, Quantization Setting=w/o DiT attention2026.05 | 95 | 96 | 100 | 98 | 86 | — | |
| SKIP-Mix70Training condition=SKIP-Mix702026.05 | 94.9 | 97.5 | 96 | 96.6 | — | 89.6 | |
| BitVLAModel Grouping=Small, Size=3.0B, Memory Usage=1.4GB (1.00×), Pre-training configuration=without pre-training2025.06 | 94.8 | 97.4 | 99.6 | 94.4 | 87.6 | — | |
| DuQuantBackbone=Pi 0.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 94.3 | 96 | 99 | 94 | 88 | — | |
| π0Model Grouping=Small, Size=3.5B, Memory Usage=7.0GB (5.00×)2025.06 | 94.2 | 96.8 | 98.8 | 95.8 | 85.2 | — | |
| π02026.03 | 94.2 | 96.8 | 98.8 | 95.8 | 85.2 | — | |
| GR00T-N1.52026.03 | 94.1 | 96.2 | 94 | 96 | 90 | — | |
| GROOT-N1Model Grouping=Small, Size=2.2B, Memory Usage=4.4GB (3.14×)2025.06 | 93.9 | 94.4 | 97.6 | 93 | 90.6 | — | |
| SKIP-Mix100Training condition=SKIP-Mix1002026.05 | 93.9 | 96.4 | 94.2 | 96 | — | 88.8 | |
| Dita2026.03 | 92.3 | 97.4 | 94.8 | 93.2 | 83.6 | — | |
| OursDINO features=true, Wrist-mounted camera observations=false2026.06 | 91.8 | 95.5 | 94 | 93.5 | 84 | — | |
| villa-xWrist-mounted camera observations=true2026.06 | 90.1 | 97.5 | 97 | 91.5 | 74.5 | — | |
| SmolVLAModel Grouping=Small, Size=2.3B, Memory Usage=4.6GB (3.29×)2025.06 | 88.8 | 93 | 94 | 91 | 77 | — | |
| 4D-VLAModel Grouping=Small, Size=4.1B, Memory Usage=8.3GB (5.93×)2025.06 | 88.6 | 88.9 | 95.2 | 90.9 | 79.1 | — | |
| UniVLA-BridgeWrist-mounted camera observations=false2026.06 | 88.1 | 90 | 86 | 90.5 | 86 | — | |
| QuantVLABackbone=GR00T N1.5, Precision=W4A8, Quantization Setting=w/o DiT attention2026.05 | 88 | 96 | 92 | 90 | 74 | — | |
| NORA-LongModel Grouping=Small, Size=3.8B, Memory Usage=7.5GB (5.36×)2025.06 | 87.9 | 92.2 | 95.4 | 89.4 | 74.6 | — | |
| Ω-QVLABackbone=GR00T N1.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 87.8 | 86 | 92 | 91 | 82 | — | |
| Full PrecisionBackbone=GR00T N1.5, Precision=FP16, Quantization Setting=No quantization2026.05 | 87 | 92 | 92 | 86 | 76 | — | |
| SmoothQuantBackbone=GR00T N1.5, Precision=W4A8, Quantization Setting=Full quantization2026.05 | 86.3 | 82 | 94 | 89 | 80 | — | |
| pi0-fastWrist-mounted camera observations=true2026.06 | 85.5 | 96.4 | 96.8 | 88.6 | 60.2 | — | |
| Ours w/o DINODINO features=false, Wrist-mounted camera observations=false2026.06 | 85.4 | 91 | 81 | 88.5 | 81 | — | |
| SmoothQuantBackbone=GR00T N1.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 84 | 87 | 84 | 83 | 82 | — | |
| QuantVLABackbone=Pi 0.5, Precision=W4A8, Quantization Setting=Full quantization2026.05 | 84 | 92 | 98 | 90 | 56 | — | |
| OmniQuantBackbone=Pi 0.5, Precision=W4A16, Quantization Setting=w/o DiT attention2026.05 | 82.8 | 85 | 94 | 74 | 78 | — | |
| QuantVLABackbone=Pi 0.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 82 | 94 | 98 | 80 | 56 | — | |
| GPTQBackbone=Pi 0.5, Precision=W4A16, Quantization Setting=w/o DiT attention2026.05 | 81.8 | 85 | 91 | 76 | 75 | — | |
| AWQBackbone=Pi 0.5, Precision=W4A16, Quantization Setting=w/o DiT attention2026.05 | 81.5 | 85 | 92 | 67 | 82 | — | |
| CoT-VLAModel Grouping=Large, Size=8.0B, Memory Usage=16.2GB (11.57×)2025.06 | 81.1 | 87.5 | 91.6 | 87.6 | 69 | — | |
| pi0Wrist-mounted camera observations=true2026.06 | 81.1 | 88 | 88.5 | 87 | 61 | — | |
| GPTQBackbone=GR00T N1.5, Precision=W4A16, Quantization Setting=w/o DiT attention2026.05 | 80.3 | 91 | 81 | 81 | 68 | — | |
| DuQuantBackbone=GR00T N1.5, Precision=W4A8, Quantization Setting=Full quantization2026.05 | 80.3 | 75 | 86 | 83 | 77 | — | |
| OmniQuantBackbone=GR00T N1.5, Precision=W4A16, Quantization Setting=w/o DiT attention2026.05 | 80 | 90 | 68 | 86 | 76 | — | |
| AWQBackbone=GR00T N1.5, Precision=W4A16, Quantization Setting=w/o DiT attention2026.05 | 78.3 | 92 | 95 | 51 | 75 | — | |
| SpatialVLAModel Grouping=Small, Size=4.2B, Memory Usage=8.5GB (6.07×)2025.06 | 78.1 | 88.2 | 89.9 | 78.6 | 55.5 | — | |
| SpatialVLAWrist-mounted camera observations=false2026.06 | 78.1 | 88.2 | 89.9 | 78.6 | 55.5 | — | |
| OpenVLAModel Grouping=Large, Size=7.5B, Memory Usage=15.1GB (10.79×)2025.06 | 76.5 | 84.7 | 88.4 | 79.2 | 53.7 | — | |
| BenignEvaluation Setup=White-box2025.11 | 76.5 | 84.7 | 88.4 | 79.2 | 53.7 | — | |
| OpenVLAWrist-mounted camera observations=false2026.06 | 76.5 | 84.7 | 88.4 | 79.2 | 53.7 | — | |
| Diffusion Policy2026.03 | 72.4 | 78.3 | 92.5 | 68.3 | 50.5 | — | |
| Diffusion PolicyWrist-mounted camera observations=false2026.06 | 72.4 | 78.3 | 92.5 | 68.3 | 50.5 | — | |
| Random NoiseEvaluation Setup=White-box2025.11 | 71.7 | 71.2 | 85.2 | 79 | 51.6 | — | |
| DuQuantBackbone=GR00T N1.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 70 | 66 | 74 | 62 | 78 | — | |
| QuantVLABackbone=GR00T N1.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 69.8 | 71 | 71 | 63 | 74 | — | |
| QuantVLABackbone=GR00T N1.5, Precision=W4A4, Quantization Setting=w/o DiT attention2026.05 | 66.5 | 62 | 74 | 60 | 70 | — | |
| LAPAWrist-mounted camera observations=false2026.06 | 65.7 | 73.8 | 74.6 | 58.8 | 55.4 | — | |
| Dense-Mix70Training condition=Dense-Mix702026.05 | 65 | 64.9 | 68.5 | 67.1 | — | 59.4 | |
| SmoothQuantBackbone=Pi 0.5, Precision=W4A4, Quantization Setting=Full quantization2026.05 | 59.3 | 83 | 88 | 40 | 26 | — | |
| AWQBackbone=GR00T N1.5, Precision=W4A16, Quantization Setting=Full quantization2026.05 | 56.8 | 38 | 74 | 51 | 64 | — | |
| GPTQBackbone=GR00T N1.5, Precision=W4A16, Quantization Setting=Full quantization2026.05 | 56.3 | 43 | 73 | 49 | 60 | — | |
| QuantVLABackbone=GR00T N1.5, Precision=W4A8, Quantization Setting=Full quantization2026.05 | 56 | 44 | 50 | 53 | 77 | — | |
| OmniQuantBackbone=GR00T N1.5, Precision=W4A16, Quantization Setting=Full quantization2026.05 | 50 | 39 | 65 | 43 | 53 | — | |
| Dense-Mix100Training condition=Dense-Mix1002026.05 | 37.5 | 38.6 | 37.7 | 38.4 | — | 35.5 | |
| GPTQBackbone=Pi 0.5, Precision=W4A16, Quantization Setting=Full quantization2026.05 | 16 | 15 | 39 | 10 | 0 | — | |
| AWQBackbone=Pi 0.5, Precision=W4A16, Quantization Setting=Full quantization2026.05 | 11.5 | 4 | 29 | 11 | 2 | — | |
| UPAEvaluation Setup=White-box2025.11 | 10.3 | 3.8 | 22.2 | 12 | 3.2 | — | |
| OmniQuantBackbone=Pi 0.5, Precision=W4A16, Quantization Setting=Full quantization2026.05 | 10.3 | 8 | 23 | 10 | 0 | — | |
| TMA (Avg.)Evaluation Setup=White-box2025.11 | 6.9 | 0.8 | 13.6 | 11.1 | 2 | — | |
| UMA1−3Evaluation Setup=White-box2025.11 | 0.5 | 0 | 1.2 | 1 | 0 | — | |
| UPA-RFASEvaluation Setup=White-box2025.11 | 0.5 | 0 | 0 | 2 | 0 | — | |
| UMA1Evaluation Setup=White-box2025.11 | 0.2 | 0 | 1 | 0 | 0 | — | |
| UADA1Evaluation Setup=White-box2025.11 | 0.2 | 0 | 0.8 | 0 | 0 | — | |
| UADA1−3Evaluation Setup=White-box2025.11 | 0 | 0 | 0 | 0 | 0 | — |