Long-horizon task success on CALVIN D→D long-horizon
99.5Success Rate (LH-1)ThinkProprio
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| ThinkProprioScale (B)=0.95, Backbone=Florence-2-L, Tokens=15, Enc.=Tokenized, Entry=VLM, Cond.=Cross-attn2026.02 | 99.5 | 97.2 | 96.6 | 92.3 | 88.5 | 4.74 | |
| FLOWER†Scale (B)=0.95, Backbone=Florence-2-L, Tokens=100, Enc.=MLP, Entry=ACT, Cond.=AdaLN2026.02 | 99.2 | 96.9 | 96.9 | 92.3 | 88.3 | 4.67 | |
| DeerVLAScale (B)=3.0, Backbone=OpenFlamingo MAE-ViT, Tokens=1282026.02 | 99.1 | 93.3 | 82.1 | 74.6 | 63.8 | 4.13 | |
| FLOWERScale (B)=0.95, Backbone=Florence-2-L, Tokens=1002026.02 | 98.9 | 96.7 | 93.9 | 90.2 | 85.5 | 4.62 | |
| RoboFlamingoScale (B)=3.0, Backbone=OpenFlamingo ViT, Tokens=1282026.02 | 96.4 | 89.6 | 82.4 | 74 | 66 | 4.09 | |
| GR-1Scale (B)=0.195, Backbone=MAE-ViT GPT, Enc.=MLP, Entry=Backbone, Cond.=In-context2026.02 | 94.9 | 89.6 | 84.4 | 78.9 | 73.1 | 4.21 | |
| Diff-P-CNNScale (B)=0.322026.02 | 86.3 | 72.7 | 60.1 | 51.2 | 41.7 | 3.16 | |
| FLOWER†Scale (B)=0.95, Backbone=Florence-2-L, Tokens=100, Enc.=MLP, Entry=ACT, Cond.=AdaLN2026.02 | 0.974 | 0.924 | 0.869 | 0.813 | 0.749 | 4.35 | |
| ThinkProprioScale (B)=0.95, Backbone=Florence-2-L, Tokens=14, Enc.=Tokenized, Entry=VLM, Cond.=Cross-attn2026.02 | 0.969 | 0.898 | 0.836 | 0.805 | 0.727 | 4.23 | |
| RoboUniView2026.02 | 0.962 | 0.888 | 0.776 | 0.666 | 0.563 | 3.85 | |
| MDT2026.02 | 0.937 | 0.845 | 0.741 | 0.644 | 0.556 | 3.72 |