Long-horizon robot manipulation on Calvin ABCD→D
99.4Task 1 Completion RateFLOWER†
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| FLOWER†Scale (B)=0.95, Backbone=Florence-2-L, Tokens=100, Enc.=MLP, Entry=ACT, Cond.=AdaLN2026.02 | 99.4 | 95.8 | 90.7 | 84.9 | 77.8 | 4.53 | |
| FLOWERScale (B)=0.95, Backbone=Florence-2-L, Tokens=1002026.02 | 99.3 | 96 | 90.3 | 82.3 | 75.5 | 4.44 | |
| UD-VLATask=ABCD→D2025.11 | 99.2 | 96.8 | 93.6 | 90.4 | 84 | 4.64 | |
| MDTTask=ABCD→D2025.11 | 98.6 | 95.8 | 91.6 | 86.2 | 80.1 | 4.52 | |
| MDTTask=ABCD→D2026.03 | 98.6 | 95.8 | 91.6 | 86.2 | 80.1 | 4.52 | |
| MDT2026.06 | 98.6 | 95.8 | 91.6 | 86.2 | 80.1 | 4.52 | |
| UD-VLA + Fast-dVLATask=ABCD→D2026.03 | 98.4 | 95.2 | 92.2 | 87 | 81.2 | 4.54 | |
| Fast-dVLA2026.06 | 98.4 | 95.2 | 92.2 | 87 | 81.2 | 4.54 | |
| UniviewVLA2026.06 | 98.3 | 95.8 | 92.8 | 89.3 | 83.8 | 4.6 | |
| DreamVLA2025.07 | 98.2 | 94.6 | 89.5 | 83.4 | 78.1 | 4.44 | |
| DeerTask=ABCD→D2026.03 | 98.2 | 90.2 | 82.1 | 75.9 | 67 | 4.13 | |
| Robovlm2025.07 | 98 | 93.6 | 85.4 | 77.8 | 70.4 | 4.25 | |
| ReconVLATask=ABCD→D2025.11 | 98 | 90 | 84.5 | 78.5 | 70.5 | 4.23 | |
| ReconVLATask=ABCD→D2026.03 | 98 | 90 | 84.5 | 78.5 | 70.5 | 4.23 | |
| ThinkProprioScale (B)=0.95, Backbone=Florence-2-L, Tokens=15, Enc.=Tokenized, Entry=VLM, Cond.=Cross-attn2026.02 | 97.7 | 96.1 | 92.2 | 86.7 | 82.1 | 4.55 | |
| MINT2026.06 | 97.4 | 94.2 | 91.7 | 88.2 | 86.1 | 4.57 | |
| FALCONTask=ABCD→D2025.10 | 97.2 | 93.3 | 90.3 | 88 | 84 | 4.53 | |
| MoDEActive Params in Million=436, PrT (Pre-trained)=true2024.12 | 97.1 | 92.5 | 87.9 | 83.5 | 77.9 | 4.39 | |
| MODETask=ABCD→D2025.11 | 97.1 | 92.5 | 87.9 | 83.5 | 77.9 | 4.39 | |
| MODETask=ABCD→D2026.03 | 97.1 | 92.5 | 87.9 | 83.5 | 77.9 | 4.39 | |
| MoDEmulti-frame=true2026.06 | 97.1 | 92.5 | 87.9 | 83.5 | 77.9 | 4.39 | |
| RoboVLMTask=ABCD→D2025.10 | 96.7 | 93 | 89.9 | 86.5 | 82.6 | 4.49 | |
| RoboVLMs2026.06 | 96.7 | 93 | 89.9 | 86.5 | 82.6 | 4.49 | |
| MoDEActive Params in Million=277, PrT (Pre-trained)=false2024.12 | 96.6 | 90.6 | 86.6 | 80.9 | 75.5 | 4.3 | |
| Robo-FlamingoType=VLA, Zero-shot=true2025.01 | 96.4 | 89.6 | 82.4 | 74 | 66 | 4.09 | |
| RoboFlamingoActive Params in Million=1000, PrT (Pre-trained)=true2024.12 | 96.4 | 89.6 | 82.4 | 74 | 66 | 4.09 | |
| Robo-FlamingoTask=ABCD→D2025.10 | 96.4 | 89.6 | 82.4 | 74 | 66 | 4.09 | |
| Robo-FlamingoTask=ABCD→D2025.11 | 96.4 | 89.6 | 82.4 | 74 | 66 | 4.09 | |
| Robo-Flamingo2026.06 | 96.4 | 89.6 | 82.4 | 74 | 66 | 4.09 | |
| Seer2025.07 | 96.3 | 91.6 | 86.1 | 80.3 | 74 | 4.28 | |
| SeerScale (B)=0.3, Backbone=ViT+CLIP2026.02 | 96.3 | 91.6 | 86.1 | 80.3 | 74 | 4.29 | |
| UP-VLAType=Prediction&VLA, Zero-shot=true2025.01 | 96.2 | 92.1 | 87.9 | 84.2 | 81.2 | 4.42 | |
| MoDEActive Params in Million=436, PrT (Pre-trained)=true2024.12 | 96.2 | 88.9 | 81.1 | 71.8 | 63.5 | 4.01 | |
| UP-VLATask=ABCD→D2025.10 | 96.2 | 92.1 | 87.9 | 84.2 | 81.2 | 4.42 | |
| UP-VLATask=ABCD→D2025.11 | 96.2 | 92.1 | 87.9 | 84.2 | 81.2 | 4.42 | |
| UP-VLATask=ABCD→D2026.03 | 96.2 | 92.1 | 87.9 | 84.2 | 81.2 | 4.42 | |
| CLOVER2025.07 | 96 | 83.5 | 70.8 | 57.5 | 45.4 | 3.53 | |
| CLOVERType=Planner + Executor, Train episodes=Lang2024.09 | 96 | 83.5 | 70.8 | 57.5 | 45.4 | 3.53 | |
| VPP2025.07 | 95.7 | 91.2 | 86.3 | 81 | 75 | 4.29 | |
| VPPScale (B)=1.5, Backbone=SVD+CLIP2026.02 | 95.7 | 91.2 | 86.3 | 81 | 75 | 4.29 | |
| LLaDA-VLATask=ABCD→D2026.03 | 95.6 | 87.8 | 79.5 | 73.9 | 64.5 | 4.01 | |
| UNIVLA2025.07 | 95.5 | 85.8 | 75.4 | 66.9 | 56.5 | 3.8 | |
| EQUIVLA2026.06 | 95 | 88.5 | 81.1 | 73.8 | 64.3 | 4.03 | |
| GR-1Type=Prediction, Zero-shot=true2025.01 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| GR-1Experiment=ABCD->D2023.12 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| GR-1Active Params in Million=130, PrT (Pre-trained)=true2024.12 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| GR-1Task=ABCD→D2025.10 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| GR-1Task=ABCD→D2025.11 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| GR-1Task=ABCD→D2026.03 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| GR-12026.06 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| UniVLA*Task=ABCD→D2025.11 | 94.8 | 90.6 | 86.2 | 83.4 | 69 | 4.26 | |
| UniVLA*Task=ABCD→D, Historical frames=without2026.03 | 94.8 | 90.6 | 86.2 | 83.4 | 69 | 4.26 | |
| RoboDual2025.07 | 94.4 | 82.7 | 72.1 | 62.4 | 54.4 | 3.66 | |
| RoboDualTrain sets=Lang2024.10 | 94.4 | 82.7 | 72.1 | 62.4 | 54.4 | 3.66 | |
| Pi02025.07 | 93.8 | 85 | 76.7 | 68.1 | 59.9 | 3.92 | |
| GR00T N1.5 + EQUIACTOR2026.06 | 93.7 | 85.8 | 77.8 | 70.1 | 61.9 | 3.89 | |
| UP-VLA2025.07 | 92.8 | 86.5 | 81.5 | 76.9 | 69.9 | 4.08 | |
| QwenGR00T2026.03 | 92.5 | 83.9 | 74.4 | 67.9 | 59.8 | 3.78 | |
| 3D Diffusor Actor2025.07 | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 | |
| 3D Diffuser ActorType=Diffusion Policy, Train episodes=Lang2024.09 | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 | |
| 3D Diffuser ActorTrain sets=Lang2024.10 | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 | |
| 3D Diffuser ActorExperiment=ABC→D2025.02 | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 | |
| AdaWorldPolicyPub.=Ours, Adaptive Online Learning=true2026.02 | 92 | 79.6 | 68.6 | 63 | 48 | — | |
| TempoFitBackbone=QwenGR00T2026.03 | 92 | 83.8 | 75.7 | 70.3 | 62.3 | 3.84 | |
| AdaWorldPolicyPub.=Ours, Adaptive Online Learning=false2026.02 | 91.8 | 79.2 | 68.5 | 62.8 | 48 | — | |
| MoDEActive Params in Million=307, PrT (Pre-trained)=false2024.12 | 91.5 | 79.2 | 67.3 | 55.8 | 45.3 | 3.39 | |
| MoDEPub.=ICLR’252026.02 | 91.5 | 79.2 | 67.3 | 55.8 | 45.3 | — | |
| OpenVLA2025.07 | 91.3 | 77.8 | 62 | 52.1 | 43.5 | 3.27 | |
| OpenVLAScale (B)=7.7, Backbone=Llama-2 DINOv2+SigLIP, Tokens=2562026.02 | 91.3 | 77.8 | 62 | 52.1 | 43.5 | 3.27 | |
| OpenVLAPub.=CoRL’242026.02 | 91.3 | 77.8 | 62 | 52.1 | 43.5 | — | |
| GR-MGPub.=RAL’252026.02 | 91 | 79.1 | 67.8 | 56.9 | 47.7 | — | |
| QwenPI2026.03 | 90.9 | 79.5 | 69.6 | 62.2 | 55.4 | 3.58 | |
| DTPExperiment=ABC→D2025.02 | 89 | 77.3 | 67.9 | 59.2 | 49.7 | 3.43 | |
| GR00T N1.52026.06 | 89 | 79.2 | 68.7 | 59.4 | 48.5 | 3.45 | |
| HULCExperiment=ABCD->D2023.12 | 88.9 | 73.3 | 58.7 | 47.5 | 38.3 | 3.06 | |
| HULCmulti-frame=true2026.06 | 88.9 | 73.3 | 58.7 | 47.5 | 38.3 | 3.07 | |
| VideoWorld 2Pretraining Type=Latent, Pretraining=OpenX, Fine-tuning=ABCD→D2026.02 | 88.5 | 64.6 | 55.8 | 47.5 | 30.9 | 2.88 | |
| Susie2025.07 | 87 | 69 | 49 | 38 | 26 | 2.69 | |
| SuSIEType=Planner + Executor, Train episodes=All2024.09 | 87 | 69 | 49 | 38 | 26 | 2.69 | |
| SuSIEActive Params in Million=860+, PrT (Pre-trained)=true2024.12 | 87 | 69 | 49 | 38 | 26 | 2.69 | |
| SuSIETrain sets=All2024.10 | 87 | 69 | 49 | 38 | 26 | 2.69 | |
| SuSIE2026.02 | 87 | 69 | 49 | 38 | 26 | 2.69 | |
| Diff-P-CNNActive Params in Million=321, PrT (Pre-trained)=false2024.12 | 86.3 | 72.7 | 60.1 | 51.2 | 41.7 | 3.16 | |
| Transformer (Oracle)Pretraining Type=Video, Pretraining=OpenX, Fine-tuning=ABCD→D2026.02 | 85.9 | 60.4 | 46 | 30.7 | 23 | 2.46 | |
| GR-12025.07 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Experiment=ABC->D2023.12 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Type=Language-conditioned Behaviour Cloning, Train episodes=Lang2024.09 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Active Params in Million=130, PrT (Pre-trained)=true2024.12 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Train sets=Lang2024.10 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Scale (B)=0.195, Backbone=MAE-ViT, Enc.=MLP, Entry=Backbone, Cond.=In-context2026.02 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Experiment=ABC→D2025.02 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | 3.06 | |
| GR-1Pub.=ICLR’242026.02 | 85.4 | 71.2 | 59.6 | 49.7 | 40.1 | — | |
| π02026.03 | 84.8 | 70.4 | 55.9 | 46.6 | 37.7 | 2.95 | |
| RT-1Type=other, Zero-shot=true2025.01 | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 | |
| RT-1Experiment=ABCD->D2023.12 | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 | |
| RT-1Task=ABCD→D2025.10 | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 | |
| RT-1Task=ABCD→D2025.11 | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 | |
| RT-1Task=ABCD→D2026.03 | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 | |
| RT-12026.06 | 84.4 | 61.7 | 43.8 | 32.3 | 22.7 | 2.45 | |
| LAPAPretraining Type=Latent, Pretraining=OpenX, Fine-tuning=ABCD→D2026.02 | 84 | 58.8 | 46.2 | 35.4 | 27 | 2.51 |