Robot Manipulation on SimplerEnv Bridge
87.5Carrot Success CountGTA-VLA
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GTA-VLAmaximum inference horizon=120 steps2026.07 | 87.5 | 81.2 | 75 | 95.8 | 66.7 | — | |
| ACE-Brain-0.5-VLAmaximum inference horizon=120 steps2026.07 | 79.2 | 82.3 | 100 | 75 | 75 | — | |
| Paligemma-2Framework=VLM4VLA, Size=3.0B2026.01 | 75 | — | 75 | 79.2 | 0 | 57.3 | |
| Paligemma-2-3BFine-tuning Protocol=Full Fine-tuning, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 75 | — | 75 | 79.2 | 0 | 57.3 | |
| X-VLAmaximum inference horizon=120 steps2026.07 | 75 | 76 | 70.8 | 95.8 | 62.5 | — | |
| Uni-VLAmaximum inference horizon=120 steps2026.07 | 66.7 | 69.8 | 95.8 | 83.3 | 33.3 | — | |
| GR00T N1maximum inference horizon=120 steps2026.07 | 65.5 | 57.1 | 93 | 64.5 | 5.5 | — | |
| pi0* (Paligemma-1)Size=3.1B2026.01 | 62.5 | — | 100 | 54.2 | 25 | 60.4 | |
| pi0*VLM Backbone=Paligemma-1, Evaluation Setting=Expert Vision-Language-Action Models2026.03 | 62.5 | — | 100 | 54.2 | 25 | 60.4 | |
| Qwen3VL-8BFramework=VLM4VLA, Size=8.8B2026.01 | 58.3 | — | 95.8 | 79.2 | 0 | 58.3 | |
| Qwen3VL-8BFine-tuning Protocol=Full Fine-tuning, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 58.3 | — | 95.8 | 79.2 | 0 | 58.3 | |
| Qwen3VL-4BFramework=VLM4VLA, Size=4.4B2026.01 | 54.2 | — | 95.8 | 75 | 0 | 56.3 | |
| Paligemma-1Framework=VLM4VLA, Size=2.9B2026.01 | 50 | — | 91.7 | 75 | 4.2 | 55.3 | |
| Paligemma-1-3BFine-tuning Protocol=Full Fine-tuning, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 50 | — | 91.7 | 75 | 4.2 | 55.3 | |
| π0maximum inference horizon=120 steps2026.07 | 41.7 | 47.9 | 70.8 | 50 | 29.2 | — | |
| ThinkAct (Qwen2.5VL-7B)Size=7.4B2026.01 | 37.5 | — | 70.8 | 58.3 | 8.7 | 43.8 | |
| KosMos-2Framework=VLM4VLA, Size=1.7B2026.01 | 37.5 | — | 100 | 75 | 29.2 | 60.4 | |
| ThinkAct*VLM Backbone=Qwen2.5VL-7B, Evaluation Setting=Expert Vision-Language-Action Models2026.03 | 37.5 | — | 70.8 | 58.3 | 8.7 | 43.8 | |
| KosMos-2-1.7BFine-tuning Protocol=Full Fine-tuning, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 37.5 | — | 100 | 75 | 29.2 | 60.4 | |
| OmniStream-7BFine-tuning Protocol=Frozen Vision, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 33.3 | — | 83.3 | 41.7 | 25 | 45.8 | |
| Qwen3VL-30B-A3BFramework=VLM4VLA, Size=31.1B2026.01 | 29.2 | — | 79.2 | 70.8 | 0 | 44.8 | |
| Qwen2.5VL-3BFramework=VLM4VLA, Size=3.8B2026.01 | 20.8 | — | 91.7 | 79.2 | 0 | 48 | |
| Qwen3VL-2BFramework=VLM4VLA, Size=2.1B2026.01 | 20.8 | — | 95.8 | 79.2 | 0 | 49 | |
| Qwen2.5VL-7BFramework=VLM4VLA, Size=8.3B2026.01 | 12.5 | — | 100 | 75 | 0 | 46.8 | |
| Qwen2.5VL-7BFine-tuning Protocol=Full Fine-tuning, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 12.5 | — | 100 | 75 | 0 | 46.8 | |
| ThinkActmaximum inference horizon=120 steps2026.07 | 8.7 | 43.8 | 70.8 | 37.5 | 58.3 | — | |
| OpenVLA (Llama-2)Size=7.7B2026.01 | 4.2 | — | 0 | 0 | 12.5 | 4.2 | |
| OpenVLA*VLM Backbone=Llama-2, Evaluation Setting=Expert Vision-Language-Action Models2026.03 | 4.2 | — | 0 | 0 | 12.5 | 4.2 | |
| Qwen2.5VL-7BFine-tuning Protocol=Frozen Vision, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 4.2 | — | 66.6 | 4.2 | 0 | 18.5 | |
| LLaVA-Video-7BFine-tuning Protocol=Frozen Vision, Evaluation Setting=VLM with VLM4VLA Models2026.03 | 0 | — | 87.5 | 33.3 | 0 | 30.2 | |
| OpenVLAmaximum inference horizon=120 steps2026.07 | 0 | 14.6 | 45.8 | 4.2 | 8.3 | — | |
| InternVL3.5-1BSize=1.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | — | 36.5 | — | — | — | — | |
| InternVL3.5-1B + EmbodiedMidtrainSize=1.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | — | 56.3 | — | — | — | — | |
| KosMos-2Size=1.7B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 60.4 | — | — | — | — | |
| Magma-8BSize=8.6B, Evaluation Protocol=Zero-shot2025.02 | — | 35.4 | — | — | — | — | |
| OctoSize=93M, Evaluation Protocol=Zero-shot2025.02 | — | 15.9 | — | — | — | — | |
| OpenVLASize=8B, Evaluation Protocol=Zero-shot2025.02 | — | 14.5 | — | — | — | — | |
| OpenVLA (Llama-2)Size=7.7B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 4.2 | — | — | — | — | |
| Paligemma-1Size=2.9B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 55.3 | — | — | — | — | |
| Paligemma-2Size=3.0B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 57.3 | — | — | — | — | |
| Qwen-VLA-Instruct2026.07 | — | 73.7 | — | — | — | — | |
| Qwen2.5VL-3BSize=3.8B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 48 | — | — | — | — | |
| Qwen2.5VL-7BSize=8.3B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 46.8 | — | — | — | — | |
| Qwen3VL-2BSize=2.1B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 49 | — | — | — | — | |
| Qwen3VL-2B (low budget)Size=2.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | — | 38.5 | — | — | — | — | |
| Qwen3VL-2B + EmbodiedMidtrainSize=2.1B, # Samples Seen=1.0M / 4.1M / 4.1M2026.04 | — | 45.8 | — | — | — | — | |
| Qwen3VL-30B-A3BSize=30B-A3B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 44.8 | — | — | — | — | |
| Qwen3VL-4BSize=4.4B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 56.3 | — | — | — | — | |
| Qwen3VL-8BSize=8.8B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 58.3 | — | — | — | — | |
| RT-1-XSize=35M, Evaluation Protocol=Zero-shot2025.02 | — | 1.1 | — | — | — | — | |
| π0 (Paligemma-1)Size=3.1B, # Samples Seen=7.7M / 25.6M / 25.6M2026.04 | — | 60.4 | — | — | — | — |