Robot Manipulation on SimplerEnv Google Robot tasks Variant Aggregation
75.9Average Success RateST4VLA
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ST4VLACo-Train=true2026.02 | 75.9 | 95.6 | 74.5 | 68 | — | — | — | — | 65.3 | — | — | |
| Green-VLAAlignment Round=R22026.01 | 73.7 | 98.2 | 71.2 | 51.6 | — | — | — | — | — | — | — | |
| ElegantVLA2026.05 | 72.54 | 82.3 | 77.17 | 73.54 | — | — | — | 3.32 | — | — | 57.14 | |
| SpatialVLAEvaluation Protocol=Fine-tuning2025.01 | 70.7 | 88 | 72.7 | 41.8 | — | — | — | — | — | — | — | |
| SpatialVLACo-Train=false2026.02 | 70.7 | 88 | 82.5 | 41.8 | — | — | — | — | — | — | — | |
| SpatialVLA2026.04 | 70.7 | 88 | 82.5 | 41.8 | — | — | — | — | — | — | — | |
| StarVLA-OFTbackbone=Qwen3-VL-4B2026.04 | 70.2 | 91.3 | 75.1 | 55 | — | — | — | — | 59.4 | — | — | |
| SpatialVLAEvaluation Protocol=Zero-shot2025.01 | 68.8 | 89.5 | 71.7 | 36.2 | — | — | — | — | — | — | — | |
| Vanilla Co-training VLACo-Train=true2026.02 | 66.5 | 82.6 | 73.5 | 62.4 | — | — | — | — | 47.5 | — | — | |
| GAE2025.10 | 65.1 | 91.9 | 75 | 28.3 | — | — | — | — | — | — | — | |
| SoFAR2025.10 | 64.8 | 90.7 | 74 | 29.7 | — | — | — | — | — | — | — | |
| RT-2-XEvaluation Protocol=Zero-shot, Dataset=OXE [13]2025.01 | 64.3 | 82.3 | 79.2 | 35.3 | — | — | — | — | — | — | — | |
| Vanilla VLACo-Train=false2026.02 | 63.5 | 92.3 | 80.3 | 50.1 | — | — | — | — | 31.4 | — | — | |
| RT-1Training Stage=Converged, Evaluation Protocol=Fine-tuning, Dataset=Fractal [6]2025.01 | 63.3 | 89.8 | 50 | 32.3 | — | — | — | — | — | — | — | |
| EfficientVLABackbone=CogACT, Sources=Arxiv’252025.11 | 63.18 | 94.8 | 77.6 | 28.4 | — | — | — | 1.54 | 51.9 | 45.1 | — | |
| LACBase Model=CogAct2026.01 | 63 | 92.1 | 81.5 | 31.2 | — | 1.506 | 37.9 | — | 47.1 | — | — | |
| VLA-CacheBackbone=CogACT, Sources=NeurIPS’252025.11 | 62.33 | 91.7 | 79.3 | 32.5 | — | — | — | 1.37 | 45.8 | 80.1 | — | |
| VLA-CacheBase Model=CogAct2026.01 | 62.3 | 91.7 | 79.3 | 32.5 | — | 1.493 | 39.11 | — | 45.8 | — | — | |
| VLA-CacheSources=NeurIPS’252026.04 | 62.3 | 91.7 | 79.3 | 32.5 | — | — | — | — | 45.8 | — | — | |
| VLA-CacheFLOPs (%)=82.6, Speedup=1.37×2026.05 | 62.3 | 91.7 | 79.3 | 32.5 | — | — | — | — | 45.8 | — | — | |
| FastVFLOPs (%)=42.0, Speedup=1.19×2026.05 | 62.1 | 91.4 | 78.6 | 27.6 | — | — | — | — | 50.6 | — | — | |
| SAFE-PrunerFLOPs (%)=36.2, Speedup=1.67×2026.05 | 61.9 | 92.1 | 79.2 | 28 | — | — | — | — | 48.1 | — | — | |
| ActDistillBackbone=CogACT, Sources=Ours2025.11 | 61.78 | 90.2 | 81.5 | 29.6 | — | — | — | 1.65 | 45.8 | 42.3 | — | |
| AC2-VLABackbone=Prismatic-7B, Action Head=DiT-Base, Action Horizon=15, Diffusion Steps=8, Action Distillation=true, Max Token Pruning Ratio=0.6, Cache Reuse Threshold=0.22026.01 | 61.6 | 88.7 | 84.4 | 28.2 | — | — | — | — | 45.1 | — | — | |
| CogACTBackbone=CogACT, Sources=Arxiv’242025.11 | 61.33 | 89.6 | 80.8 | 28.3 | — | — | — | 1 | 46.6 | 100 | — | |
| CogACTCo-Train=false2026.02 | 61.3 | 89.6 | 80.8 | 28.3 | — | — | — | — | 46.6 | — | — | |
| Baseline (CogAct)Base Model=CogAct2026.01 | 61.3 | 89.6 | 80.8 | 28.3 | — | 1.807 | 53.54 | — | 46.6 | — | — | |
| CogACTPrecision=Full precision2026.01 | 61.3 | 89.6 | 80.8 | 28.3 | — | — | — | — | 46.6 | — | — | |
| CogACT2026.04 | 61.3 | 89.6 | 80.8 | 28.3 | — | — | — | — | 46.6 | — | — | |
| CogACT (FP)Sources=Arxiv’242026.04 | 61.3 | 89.6 | 80.8 | 28.3 | — | — | — | — | 46.6 | — | — | |
| CogACT2026.05 | 61.3 | 89.6 | 80.8 | 28.3 | — | — | — | 1 | — | — | 46.6 | |
| CogACTFLOPs (%)=100.0, Speedup=1.00×2026.05 | 61.3 | 89.6 | 80.8 | 28.3 | — | — | — | — | 46.6 | — | — | |
| MoLe-VLABackbone=CogACT, Sources=Arxiv’252025.11 | 61.2 | 89.2 | 79.5 | 29.9 | — | — | — | 1.56 | 46.2 | 43.2 | — | |
| MoLe-VLA2026.05 | 61.2 | 89.2 | 79.5 | 29.9 | — | — | — | 1.49 | — | — | 46.2 | |
| VanillaSparsity=02026.01 | 61 | 88.7 | 76.8 | 26.7 | 51.9 | 1.81 | 105.87 | 1 | — | — | — | |
| EcoVLASparsity=40%2026.01 | 60.6 | 86.1 | 74.3 | 33.1 | 48.7 | 1.28 | 66.25 | 1.6 | — | — | — | |
| TTT-VLAState Grounded Latent Prompt=true, Test-Time Training=true2026.06 | 60.1 | 79.3 | 55.2 | 45.8 | — | — | — | — | — | — | — | |
| π0-FASTCo-Train=false2026.02 | 59 | 77.6 | 68.2 | 31.3 | — | — | — | — | — | — | — | |
| π0-FAST2026.04 | 59 | 77.6 | 68.2 | 31.3 | — | — | — | — | — | — | — | |
| π0-FastProtocol=fine-tuned2026.06 | 59 | 77.6 | 68.2 | 31.3 | — | — | — | — | — | — | — | |
| π0-FAST2025.10 | 59 | 77.6 | 68.2 | 31.3 | — | — | — | — | — | — | — | |
| EcoVLASparsity=25%2026.01 | 58.6 | 85.9 | 75.3 | 27.2 | 46 | 1.47 | 73.98 | 1.43 | — | — | — | |
| π0.5 + SG-LPState Grounded Latent Prompt=true2026.06 | 58.6 | 81.7 | 51.2 | 42.9 | — | — | — | — | — | — | — | |
| π0.5Description=baseline fine-tuned from original checkpoint2026.06 | 58.1 | 82 | 47.7 | 44.7 | — | — | — | — | — | — | — | |
| VLA-Cache2026.05 | 57.27 | 80 | 75 | 30.69 | — | — | — | 1.47 | — | — | 43.39 | |
| Green-VLAAlignment Round=R12026.01 | 56.3 | 92.1 | 42.9 | 34.1 | — | — | — | — | — | — | — | |
| RT-1Training Stage=15%, Evaluation Protocol=Fine-tuning, Dataset=Fractal [6]2025.01 | 56.2 | 81.3 | 44.6 | 26.7 | — | — | — | — | — | — | — | |
| FastV2026.05 | 54.91 | 76 | 71.67 | 24.34 | — | — | — | 1.29 | — | — | 47.62 | |
| π0Co-Train=false2026.02 | 54.8 | 75.2 | 63.7 | 25.6 | — | — | — | — | — | — | — | |
| pi_0Mode=Fine-tune2026.01 | 54.8 | 75.2 | 63.7 | 25.6 | — | — | — | — | — | — | — | |
| π02026.04 | 54.8 | 75.2 | 63.7 | 25.6 | — | — | — | — | — | — | — | |
| π0Protocol=fine-tuned2026.06 | 54.8 | 75.2 | 63.7 | 25.6 | — | — | — | — | — | — | — | |
| π02025.10 | 54.8 | 75.2 | 63.7 | 25.6 | — | — | — | — | — | — | — | |
| RT-2-XCo-Train=true2026.02 | 54.4 | 82.3 | 79.2 | 35.3 | — | — | — | — | 20.6 | — | — | |
| RT-2-XPrecision=Full precision2026.01 | 54.4 | 82.3 | 79.2 | 35.3 | — | — | — | — | 20.6 | — | — | |
| RT-2-X2026.04 | 54.4 | 82.3 | 79.2 | 35.3 | — | — | — | — | 20.6 | — | — | |
| SOMAPre-training=OXE (O’Neill et al., 2024), Fine-tuning=Fractal (Brohan et al., 2022)2026.05 | 52.5 | 55.5 | 76.6 | 25.4 | — | — | — | — | — | — | — | |
| DA-PTQSources=—2026.04 | 51.7 | 87.5 | 74.5 | 20.1 | — | — | — | — | 24.7 | — | — | |
| MagmaCo-Train=true2026.02 | 51.6 | 68.8 | 65.7 | 53.4 | — | — | — | — | 18.5 | — | — | |
| Magma2026.04 | 51.6 | 68.8 | 65.7 | 53.4 | — | — | — | — | 18.5 | — | — | |
| GR00T-N12025.10 | 51.5 | 78.8 | 62.5 | 13.2 | — | — | — | — | — | — | — | |
| RoboVLMEvaluation Protocol=Fine-tuning, Dataset=Fractal [6]2025.01 | 51.3 | 75.6 | 60 | 10.6 | — | — | — | — | — | — | — | |
| RoboVLMPre-training=OXE (O’Neill et al., 2024), Fine-tuning=Fractal (Brohan et al., 2022)2026.05 | 51.3 | 75.6 | 60 | 10.6 | — | — | — | — | — | — | — | |
| RoboVLMProtocol=fine-tuned2026.06 | 51.3 | 75.6 | 60 | 10.6 | — | — | — | — | — | — | — | |
| QuantVLASources=CVPR’262026.04 | 49.4 | 84.9 | 76.7 | 20.3 | — | — | — | — | 15.8 | — | — | |
| Green-VLAAlignment Round=R02026.01 | 49.1 | 75.5 | 38.1 | 33.5 | — | — | — | — | — | — | — | |
| RoboVLMEvaluation Protocol=Zero-shot, Dataset=OXE [13]2025.01 | 46.3 | 68.3 | 56 | 8.5 | — | — | — | — | — | — | — | |
| RoboVLMProtocol=zero-shot2026.06 | 46.3 | 68.3 | 56 | 8.5 | — | — | — | — | — | — | — | |
| OpenVLA-OFTPre-training=OXE (O’Neill et al., 2024), Fine-tuning=Fractal (Brohan et al., 2022)2026.05 | 45.5 | 65.3 | 59 | 12.2 | — | — | — | — | — | — | — | |
| DeFI2026.03 | 45.4 | 53.9 | 58.2 | 24 | — | — | — | — | — | — | — | |
| TraceVLAEvaluation Protocol=Zero-shot, Dataset=OXE [13]2025.01 | 45 | 60 | 56.4 | 31 | — | — | — | — | — | — | — | |
| TraceVLA2026.03 | 45 | 60 | 56.4 | 31 | — | — | — | — | — | — | — | |
| TraceVLAPre-training=OXE (O’Neill et al., 2024), Fine-tuning=Fractal (Brohan et al., 2022)2026.05 | 45 | 60 | 56.4 | 31 | — | — | — | — | — | — | — | |
| TraceVLA2026.06 | 45 | 60 | 56.4 | 31 | — | — | — | — | — | — | — | |
| GR00T N1.5Co-Train=false2026.02 | 44.5 | 69.3 | 68.7 | 35.8 | — | — | — | — | 4 | — | — | |
| GR00T N1.52026.04 | 44.5 | 69.3 | 68.7 | 35.8 | — | — | — | — | 4 | — | — | |
| RT-1Co-Train=false2026.02 | 43.7 | 89.8 | 50 | 32.3 | — | — | — | — | 2.6 | — | — | |
| RT-1Precision=Full precision2026.01 | 43.7 | 89.8 | 50 | 32.3 | — | — | — | — | 2.6 | — | — | |
| RT-12026.04 | 43.7 | 89.8 | 50 | 32.3 | — | — | — | — | 2.6 | — | — | |
| GR00TProtocol=fine-tuned2026.06 | 43.7 | 46.7 | 62.9 | 17.5 | — | — | — | — | — | — | — | |
| GR00T-N1.5Pre-training=OXE (O’Neill et al., 2024), Fine-tuning=Fractal (Brohan et al., 2022)2026.05 | 42.4 | 46.7 | 62.9 | 17.5 | — | — | — | — | — | — | — | |
| OpenVLAEvaluation Protocol=Zero-shot, Dataset=OXE [13]2025.01 | 39.8 | 54.5 | 47.7 | 17.7 | — | — | — | — | — | — | — | |
| OpenVLA2026.01 | 39.8 | 54.5 | 47.7 | 17.7 | — | — | — | — | — | — | — | |
| OpenVLA2026.03 | 39.8 | 54.5 | 47.7 | 17.7 | — | — | — | — | — | — | — | |
| OpenVLAPre-training=OXE (O’Neill et al., 2024), Fine-tuning=Fractal (Brohan et al., 2022)2026.05 | 39.8 | 54.5 | 47.7 | 17.7 | — | — | — | — | — | — | — | |
| OpenVLA2026.06 | 39.8 | 54.5 | 47.7 | 17.7 | — | — | — | — | — | — | — | |
| OpenVLA2025.10 | 39.8 | 54.5 | 47.7 | 17.7 | — | — | — | — | — | — | — | |
| RT-1-X2025.10 | 39.7 | 49 | 32.3 | 29.4 | — | — | — | — | — | — | — | |
| RT-1-XEvaluation Protocol=Zero-shot, Dataset=OXE [13]2025.01 | 39.6 | 49 | 32.3 | 29.4 | — | — | — | — | — | — | — | |
| RT-1-X2026.01 | 39.6 | 29.7 | 32.3 | 49 | — | — | — | — | — | — | — | |
| RT-1-X2026.06 | 39.6 | 49 | 32.3 | 29.4 | — | — | — | — | — | — | — | |
| TIESRetained tokens=562026.03 | 39.44 | — | — | — | — | — | — | — | — | — | — | |
| OpenVLACo-Train=false2026.02 | 39.3 | 60.8 | 67.7 | 28.8 | — | — | — | — | 0 | — | — | |
| OpenVLAPrecision=Full precision2026.01 | 39.3 | 60.8 | 67.7 | 28.8 | — | — | — | — | 0 | — | — | |
| Full tokensRetained tokens=Full2026.03 | 39.3 | — | — | — | — | — | — | — | — | — | — | |
| OpenVLA2026.04 | 39.3 | 60.8 | 67.7 | 28.8 | — | — | — | — | 0 | — | — | |
| FastVRetained tokens=562026.03 | 31.47 | — | — | — | — | — | — | — | — | — | — | |
| RT-1-XCo-Train=false2026.02 | 30.2 | 49 | 32.3 | 29.4 | — | — | — | — | 10.1 | — | — | |
| RT-1-XPrecision=Full precision2026.01 | 30.2 | 49 | 32.3 | 29.4 | — | — | — | — | 10.1 | — | — | |
| RT-1-X2026.04 | 30.2 | 49 | 32.3 | 29.4 | — | — | — | — | 10.1 | — | — |