Robotic Manipulation on LIBERO-10
96Success RateAWP
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AWPStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| π0.5 + Retrieve-then-SteerBase Policy (VLA Model)=π0.5, Test-time Steering/Scaling Method=Retrieve-then-Steer2026.05 | 94.4 | — | — | — | — | — | — | 100 | 100 | 98 | 100 | 96 | 92 | 94 | 100 | 70 | 94 | |
| MODEStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenVLA-OFTStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Robot-DIFTaction steps=16, executed steps=8, backbone=frozen2026.02 | 93 | 0.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| π0.5Base Policy (VLA Model)=π0.52026.05 | 92.4 | — | — | — | — | — | — | 90 | 100 | 96 | 94 | 96 | 100 | 94 | 96 | 64 | 94 | |
| AWPStatic Camera=true, Gripper Camera=false, Joint States=false2026.02 | 91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UVAaction steps=16, executed steps=82026.02 | 90 | 0.23 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UVAStatic Camera=true, Gripper Camera=false, Joint States=false2026.02 | 89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Sparse2ActAdaptation setting=in-domain, Demonstrations=full available LIBERO-10 downstream demonstrations, Pretraining=LIBERO-10, Checkpoint selection protocol=fixed 500-step checkpoint, Evaluation episodes=50 per seed across 3 seeds2026.06 | 86.9 | — | — | — | — | — | — | 83.3 | 88.7 | 100 | 92.7 | 84.7 | 100 | 75.3 | 76 | 78 | 90 | |
| π0action steps=16, executed steps=82026.02 | 85 | 0.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| π0 + Retrieve-then-SteerBase Policy (VLA Model)=π0, Test-time Steering/Scaling Method=Retrieve-then-Steer2026.05 | 84.4 | — | — | — | — | — | — | 84 | 92 | 96 | 96 | 82 | 96 | 80 | 94 | 38 | 86 | |
| π0 + TACOBase Policy (VLA Model)=π0, Test-time Steering/Scaling Method=TACO2026.05 | 83.8 | — | — | — | — | — | — | 82 | 94 | 92 | 92 | 82 | 94 | 82 | 96 | 36 | 88 | |
| MIPt* value=0.9, Finetuning steps=50k, Pre-trained policy=pi02025.12 | 82.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowIntegration steps=10, Finetuning steps=50k, Pre-trained policy=pi02025.12 | 81.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| π0Base Policy (VLA Model)=π02026.05 | 81.6 | — | — | — | — | — | — | 78 | 98 | 84 | 90 | 84 | 96 | 82 | 98 | 30 | 76 | |
| Centralized# Params (M)=3882.72, # Trainable Params (M)=128.102026.05 | 79 | — | — | — | — | — | 100 | — | — | — | — | — | — | — | — | — | — | |
| RCPLoss function=l2 loss, Finetuning steps=50k, Pre-trained policy=pi02025.12 | 78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gaze-Regularized VLAGaze Regularization=Enabled, Steps=30k2026.03 | 77.9 | — | — | — | — | 11.8 | — | — | — | — | — | — | — | — | — | — | — | |
| FlowVLAStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Base ModelGaze Regularization=Disabled, Steps=30k2026.03 | 66.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ForgeVLA# Params (M)=3882.72, # Trainable Params (M)=128.102026.05 | 63.6 | — | — | — | — | — | 100 | — | — | — | — | — | — | — | — | — | — | |
| RCPLoss function=l1 loss, Finetuning steps=50k, Pre-trained policy=pi02025.12 | 62.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| π0-FASTBase Policy (VLA Model)=π0-FAST2026.05 | 60.2 | — | — | — | — | — | — | 74 | 72 | 62 | 52 | 54 | 82 | 58 | 72 | 26 | 50 | |
| π0-FASTaction steps=16, executed steps=82026.02 | 60 | 0.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pi0-fastStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 60 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gaze-Regularized VLAGaze Regularization=Enabled, Steps=20k2026.03 | 58.3 | — | — | — | — | 4.5 | — | — | — | — | — | — | — | — | — | — | — | |
| DP-Taction steps=16, executed steps=82026.02 | 58 | 0.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpatialVLAStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-2BSize=2.1B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 55.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| KosMos-2Size=1.7B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-1B + EmbodiedMidtrainSize=1.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | 54.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenVLAaction steps=1, execution count=82026.02 | 54 | 1.52 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenVLAStatic Camera=true, Gripper Camera=true, Joint States=true2026.02 | 54 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenVLABase Policy (VLA Model)=OpenVLA2026.05 | 54 | — | — | — | — | — | — | 60 | 76 | 58 | 36 | 32 | 82 | 60 | 70 | 20 | 46 | |
| Base ModelGaze Regularization=Disabled, Steps=20k2026.03 | 53.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OpenVLA (Llama-2)Size=7.7B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 53.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP-Caction steps=16, executed steps=82026.02 | 53 | 0.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FedAvg# Params (M)=3882.72, # Trainable Params (M)=128.102026.05 | 52.8 | — | — | — | — | — | 100 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-30B-A3BSize=30B-A3B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 46.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-8BSize=8.8B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 46.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Paligemma-2Size=3.0B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 46.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| π0 (Paligemma-1)Size=3.1B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 46 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5VL-7BSize=8.3B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-4BSize=4.4B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 44.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Paligemma-1Size=2.9B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 44.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5VL-3BSize=3.8B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | 43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Base ModelGaze Regularization=Disabled, Steps=10k2026.03 | 42.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gaze-Regularized VLAGaze Regularization=Enabled, Steps=10k2026.03 | 41.7 | — | — | — | — | 0.8 | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-2B + EmbodiedMidtrainSize=2.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | 40.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-1BSize=1.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | 39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3VL-2B (low budget)Size=2.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | 33.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DP3Adaptation setting=in-domain, Preprocessing=1024-point xyz, Downstream training steps=20,000, Checkpoint selection protocol=top-five average over checkpoints evaluated every 2,000 steps, Evaluation episodes=50 per seed across 3 seeds2026.06 | 29.1 | — | — | — | — | — | — | 0 | 0 | 100 | 90 | 8 | 0 | 35 | 0 | 11 | 47 | |
| FedVLA* + CLIP# Params (M)=519.82, # Trainable Params (M)=92.902026.05 | 9.4 | — | — | — | — | — | 20 | — | — | — | — | — | — | — | — | — | — | |
| FedVLA*# Params (M)=79.23, # Trainable Params (M)=79.232026.05 | 0.4 | — | — | — | — | — | 10 | — | — | — | — | — | — | — | — | — | — | |
| UniPiaction steps=16, executed steps=82026.02 | 0 | 24.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adversarial-VLAModel Architecture=OpenVLA-7B2026.01 | — | — | 89.2 | 64.5 | 28.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BadNetModel Architecture=OpenVLA-7B2026.01 | — | — | 90.5 | 88.6 | 4.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BadVLAModel Architecture=OpenVLA-7B2026.01 | — | — | 85 | 66.4 | 25.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BadVLAModel Architecture=pi0.52026.01 | — | — | 82 | 50.8 | 39.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BadVLATrigger Type=White Pixel2026.03 | — | — | 72.9 | — | 95 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BadVLATrigger Type=Object State2026.03 | — | — | 74.7 | — | 62.2 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BadVLATrigger Type=Scene Semantic2026.03 | — | — | 69.6 | — | 67.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Baseline (π0 libero)2026.03 | — | — | 85.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowHijack (IP)Trigger Type=White Pixel2026.03 | — | — | 79.8 | — | 86.7 | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowHijack (IP)Trigger Type=Object State2026.03 | — | — | 82.8 | — | 64.4 | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowHijack (IP)Trigger Type=Scene Semantic2026.03 | — | — | 81.8 | — | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowHijack (PL)Trigger Type=White Pixel2026.03 | — | — | 82 | — | 100 | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowHijack (PL)Trigger Type=Object State2026.03 | — | — | 82.2 | — | 57.8 | — | — | — | — | — | — | — | — | — | — | — | — | |
| FlowHijack (PL)Trigger Type=Scene Semantic2026.03 | — | — | 79.1 | — | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | |
| INFUSEModel Architecture=OpenVLA-7B2026.01 | — | — | 92.2 | 5.4 | 91.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| INFUSEModel Architecture=pi0.52026.01 | — | — | 88.8 | 3.2 | 93.1 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Normal ModelModel Architecture=OpenVLA-7B2026.01 | — | — | 95.1 | 93.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Normal ModelModel Architecture=pi0.52026.01 | — | — | 92 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | — |